İçindekiler13 başlık
Bir web sayfasını chatbot'un bilgi tabanına koymanın iki yolu var. Birincisi sayfadan çıkarılan metni olduğu gibi aktarmak. İkincisi bir dil modelinden geçirmek: gereksiz satırları at, yapıyı düzelt, sayfanın hangi soruları cevapladığını ve hangi ürünleri anlattığını çıkar.
İkinci yol daha temiz bir bilgi tabanı vaat ediyor ama iki riski var: para ve uydurma. Model temizlerken bir fiyatı değiştirebilir, bir istisnayı düşürebilir. Dolphy'de bu soruyu gerçek sitelerde ölçtük.
Ham metin ne kadar kötü?
Dört farklı sayfa şekli seçtik: bir ürün sayfası (teknik özellik tablosu), bir iade politikası sayfası, bir emlak ilanı listesi ve bir bilgi yazısı.
Ham metnin kalitesi sayfadan sayfaya uçurum kadar değişti. Ürün sayfasında bütün teknik özellikler yapılandırılmış verinin tek bir hücresinde düz yazı olarak duruyordu ("Çalışma gerilimi : +5 V DC . Tavsiye edilen besleme gerilimi : 7 - 12 V DC. …"), araya "3.9", "İndirim Oranı", ":" gibi kopuk satırlar karışmıştı. Politika sayfasında asıl metin temizdi ama başında menü, sonunda yaklaşık 100 satır kategori listesi, altbilgi ve çerez uyarısı vardı.
Tek sayfaya bakmak ise ham metni haksız yere kötü gösteriyor. Çok sayfalı taramada menüyü istatistiksel olarak ayıklayan adım (ayrıntı) aynı sitenin dört sayfasında atılacak satırları buldu: ürün sayfasında %2, politika sayfasında %52, kategori sayfasında %1, bir başka ürün sayfasında %73. Menü gürültüsü asıl olarak tek adresli kaynaklarda ve yüklenen dosyalarda kalıyor, çünkü orada karşılaştıracak başka sayfa yok.
Her sayfayı yeniden yazmak: kapı neredeyse her şeyi reddetti
Yeniden yazım bir sadakat kapısından geçiyor. Kapı modelin çıktısını kaynakla karşılaştırıyor: sayılar korunmuş mu, olumsuzluklar ("iade edilmez", "hariç") yerinde mi, tablo satırları kaybolmuş mu, çıktı kaynağa göre fazla kısalmış mı? Kapıdan geçemeyen yeniden yazım atılıyor ve ham metin kalıyor.
İlk ölçümde dört sayfanın yalnız birinde yeniden yazım kabul edildi. Diğer üçünde modele para ödenmiş, ham metin kalmıştı. Retlerin gerekçelerini tek tek okuyunca üçünün de yanlış alarm olduğu çıktı:
- "Hariç" kelimesi. Kaynak: "…iade kabul edilmez (ayıplı ürünler hariç)." Çıktı: "…iade kabul edilmez. Ayıplı ürünler bu koşulun dışındadır." Anlam ve yön aynı. Kapı olumsuzluk kelimelerini birebir karşılaştırdığı için "hariç" düşünce reddetti. Bir başka sayfa %100 sadakat puanıyla aynı gerekçeyle düşmüştü.
- Kendi ürettiğimiz tablo. Kapı "tablo satırı kayboldu" diyordu. Kaybolan satır sayfanın tablosu değil, bizim yapılandırılmış veriden ürettiğimiz özet satırıydı; model yalnız başlığın sonundaki site adını atmıştı.
- Telif yılı. Bir düzeltmeden sonra aynı sayfa bu kez "sayısal bilgi kaybı: 2024" ile düştü. Kaynaktaki "© 2024" dört haneli olduğu için olgu sayılıyordu. Model altbilgiyi doğru olarak atınca kapı, temizlemesi için para ödediğimiz gürültüyü koruyordu.
Olumsuzluk artık kelimeyle değil sınıfla karşılaştırılıyor ("hariç", "dışında", "değil" aynı sınıfta). Yön yine korunuyor: kaynakta olmayan bir olumsuzluk çıktıda belirirse kapı kapanıyor. Kendi ürettiğimiz blok kapının tablo kontrolüne girmiyor; telif iminin yanındaki yıl anlamlı sayılmıyor.
Daha önce aynı kapıda üç yanlış alarm daha yakalamıştık: bir tarih ("31.12.2027") sayı gibi birleştirilip "31122027" oluyordu ve bu yüzden sayfaların %21'i boşuna reddediliyordu; boşluklu sayılar ("50 40 30 20 10") yapışıyordu; Türkçe ek farkı ("köpeğim" / "köpeğin") bozulma sanılıyordu. Başka bir sitede kapı ilk geçişte 45 sayfanın 41'ini reddetmişti, çünkü olumsuzluk taşıyan her satırın birebir aynı kalmasını istiyordu. Yeniden yazmanın tanımı satırı yeniden akıtmaktır.
Doğru kademe: sayfaya göre
Ölçümün vardığı yer iki ucun da yanlış olduğuydu.
- "Yapay zekâ olmadan aktar" yanlış. Kart alanları (ürün adı, fiyat, görsel), arama için kullanılan özet metin (özet, kalem adları, sayfanın cevapladığı sorular) ve konu etiketi aynı model çağrısından geliyor. İlan listesi ham hâlde 0, yapay zekâ ile 6 kart üretti.
- "Her sayfayı baştan yaz" da yanlış. Kalem tanıtan sayfalarda (ürün, ilan) ham metin yeterli; yeniden yazım kart sayısını artırmıyor.
Varsayılan kademe sayfaya göre karar veriyor: önce yalnız kart ve etiket çıkaran ucuz bir çağrı, kalem tanıtmayan sayfalarda (politika, bilgi) tam yeniden yazım. Kapı düzeltmesiyle birlikte aynı dört sayfada:
| Önce | Sonra | |
|---|---|---|
| Kabul edilen yeniden yazım | 1/4 | 4/4 |
| Maliyet (4 sayfa) | 0,0301 $ | 0,0124 $ |
| Reddedilen çıktı için onarım çağrısı | var | yok |

Kapı gevşedi diye uydurma riski artmadı mı? Bunu ayrıca ölçtük. Depodaki 40 vakalık hakemli bir karşılaştırmada tam yeniden yazılmış bilgi tabanı, yalnız kart çıkarılmış olana göre daha dayanaklı cevap verdi: 40'ta 31'e karşı 27. Kayıp, kalem tanıtmayan sayfalarda toplanıyordu; yeni kademenin kuralı da tam olarak bu.
İki sessiz hata
Önbellek kararı taşıyordu. Yeniden yazımlar önbelleğe alınıyor; aynı sayfa ikinci kez taranınca modele gidilmiyor. Önbellekte çıktıyla birlikte kapının o günkü kararı da saklanıyordu. Kapıyı düzelttik ama ikinci taramada 50 sayfanın hepsi eski kararla döndü; düzeltme canlıya hiç ulaşmamıştı. Artık önbellek yalnız çıktıyı taşıyor ve karar her seferinde kaynak metne karşı yeniden veriliyor. Reddedilen çıktı da önbelleğe yazılıyor; böylece kapı değişince para ödemeden yeniden yargılanabiliyor.
Yeniden yazım kapanmıştı. Bir kod değişikliğinden sonra yeniden yazımın kapısı "seçenek açıkça verilmediyse çalışma" diye kalmıştı ve hiçbir yer bu seçeneği vermiyordu. Her yeni sitede yeniden yazım ve ürün kartları sessizce kaybolacaktı. Bir test taramasında fark edildi.
Maliyet: tahminimiz 3 kat düşüktü
Sayfa başı maliyeti önce ince içerikli bir danışmanlık sitesinden tahmin etmiştik: 0,0017 dolar. Ürün kataloğu olan bir sitede ölçünce 0,00489 dolar çıktı. Katalog sayfası özellik dolu: ortalama 5.292 giriş ve 3.252 çıkış token'ı.
Maliyetin %79'u çıkış token'larındaydı, çünkü modelden sayfayı yeniden yazmasını istiyorduk ve çıkış token'ı girişten 6 kat pahalı. Yalnız etiket ve kart çıkaran çağrı sayfa başına 0,00136 dolar (%73 daha ucuz). Sayfaya göre kademe kararının maliyet tarafı buydu.
Başka bir sitede fark daha büyük çıktı: beklenen 0,10 dolar yerine 0,48 dolar. Sebep modelin düşünme token'larıydı: 62 çağrı 497 bin giriş ve 218 bin çıkış token'ı üretti. Bu hızda sayfa başı yaklaşık 0,007 dolar ediyordu. Önceki tahmin yalnız embedding maliyetini sayıyordu.
| Site boyu | Kurulum maliyeti (0,00489 $/sayfa) |
|---|---|
| 25 sayfa | 0,12 $ |
| 100 sayfa | 0,49 $ |
| 250 sayfa | 1,22 $ |
| 500 sayfa | 2,45 $ |
Bu maliyet tek seferlik. Yeniden taramada değişmeyen sayfalar önbellekten geliyor; 372 sayfalık bir yeniden koşuda 274 sayfa (%74) modele hiç gitmedi.
Kart olmaması gerekenler
Yeniden yazım kartları da üretiyor, ve bir kart her zaman kart olmamalı. Dolphy'nin kendi sitesinde "Tidio'dan farkınız ne?" sorusunun altına Dolphy, Tidio ve Chatwoot kartları çıktı: karşılaştırma blog yazılarındaki rakip ürünler kalem sayılmıştı. "Kart olmayanlar" kuralları (blog yazısı, işletmenin kendi adı, başka firmanın ürünü, kategori ve marka dizini) yalnız tam yeniden yazım promptundaydı; varsayılan kademe önce kart promptunu koşuyordu ve orada yoktu. Kurallar ortak bir listeye taşındı. Dolphy sitesinde kart sayısı 89'dan 28'e, blog kartı 51'den 0'a indi; mağaza sitesindeki 24 ürün kartı aynen kaldı.
Kendi hattınızda nasıl uygularsınız?
- Yeniden yazımı bir kapıdan geçirin. Sayı, olumsuzluk ve tablo satırı korunmuyorsa ham metin kalsın.
- Kapının reddini okuyun. İlk sürüm kapılar genellikle yanlış alarm verir; her ret para ödenmiş bir çıktıdır.
- Önbellekte karar değil çıktı saklayın. Aksi hâlde kapı düzeltmesi hiç uygulanmaz.
- Sayfaya göre kademe seçin. Kalem tanıtan sayfa ile politika sayfası aynı işlemi gerektirmez.
- Maliyeti gerçek katalogla ölçün. İnce sayfalardan yapılan tahmin, özellik dolu sayfalarda kat kat düşük kalır; düşünme token'larını da sayın.
Ölçümün sınırları
Kapı düzeltmesinin ilk ölçümü dört sayfayla yapıldı; yön gösterir, oran değildir. Dayanaklılık karşılaştırması 40 vakalık tek bir setten geliyor. Maliyetler ölçüm tarihindeki model fiyatlarıyla hesaplandı ve kullanılan modele göre değişir.
Sık sorulan sorular
Bu bölümdeki sorular, aynı konuda en sık arananlardan derlendi.
01Chatbot bilgi tabanına site içeriği ham aktarılabilir mi?
Aktarılabilir ama kayıp olur. Ürün kartları, arama için özet metin ve konu etiketleri genellikle bir model çağrısından gelir. Ham aktarım özellikle teknik özelliklerin tek hücreye sıkıştığı sayfalarda ve menüsü ayıklanamayan tek sayfalık kaynaklarda zayıf kalır.
02Yapay zekâ ile yeniden yazım uydurma riski taşır mı?
Taşır. Bu yüzden çıktı kaynakla karşılaştırılmalı: sayılar, olumsuzluklar ve tablo satırları korunmuyorsa ham metin kullanılmalı. Kapıyı kurduktan sonra ret gerekçelerini tek tek okumak önemli; bizim ilk kapımız doğru çıktıları da reddediyordu.
03Bir web sitesini bilgi tabanına çevirmek ne kadar tutar?
Bizim ölçümümüzde ürün kataloğu olan bir sitede sayfa başı yaklaşık 0,005 dolar; düşünme token'ları açık bir modelde 0,007 dolar. 250 sayfalık bir site için bu yaklaşık 1,2 dolar eder ve tek seferliktir. İnce içerikli sitelerde maliyet daha düşük.
04Yeniden taramada maliyet tekrar ödenir mi?
Değişmeyen sayfalar için ödenmemeli. Sayfa içeriğinin parmak izine göre çalışan bir önbellek, bizim bir yeniden koşumuzda sayfaların %74'ünü modele göndermeden çözdü.
Mustafa Gürbüz
Dolphy Yöneticisi
Dolphy'nin yöneticisi. Sesli asistan, yazılı sohbet ve bilgi tabanı hattındaki testleri yürütüyor. Yazılardaki sayılar Dolphy'nin kendi test ortamında alınan ölçümlerden geliyor; her yazı ölçümün kapsamını ve sınırını da söylüyor.
İçerik 28 Eylül 2026 tarihinde kontrol edildi
Aynı soruları müşterilere tekrar tekrar yazmayın
Dolphy web sitesi, WhatsApp ve Instagram'da işletmenizin kendi bilgisiyle yanıt verir, talepleri panele düşürür.



