Dolphy Docs

İçerikten aranabilir bilgiye

Bilgi hattının amacı bir belgeyi saklamak değil, müşteri sorusuyla bulunabilecek ve kaynağı izlenebilecek parçalar üretmektir.

Çıkarma

Web sayfalarında ana içerik menü, çerez bandı ve tekrar eden sayfa kabuğundan ayrılır. Dosyalarda biçime uygun ayrıştırıcı kullanılır: PDF metni ve sayfa konumu, DOCX başlıkları, Excel/CSV tablo satırları ve düz metin kodlaması korunmaya çalışılır. Okunamayan ya da yarım kalan dosya hazır sayılmaz.

Tarama iki aşamalıdır: önce sayfalar indirilir ve bir kontrol noktasıyla saklanır, sonra tekrar eden içerik ayıklanıp parçalanır. Aynı içeriğe sahip sayfalardan yalnızca biri tutulur; en kısa adres seçilir, çünkü kaynak kimliği olarak en kararlı olan odur. noindex sayfalar taranmaz.

Görünür metni çok az olan sayfalarda tarayıcı tabanlı görüntüleme devreye girer; aksi hâlde bu adım atlanır. Taranan PDF'ler de metne çevrilir. Taranmış görüntülü PDF'ler için okuma yapılmaz; bu tür belgelerde okunabilir bir metin sürümü sağlamak daha güvenilirdir.

Temizleme ve yapı

Boş bölümler, yinelenen kalıplar ve aramaya değer katmayan öğeler azaltılır. Başlık yolu parçaya eklenir; böylece “İade > Koşullar” gibi bağlam, tek bir paragraf bulunduğunda da taşınır. Tablolar bölündüğünde sütun başlıklarının korunması, değerin neyi anlattığını kaybetmemesini sağlar.

Parçalama ve embedding

İçerik sabit karakter aralıklarında körlemesine kesilmez. Başlık, paragraf ve tablo sınırları gözetilerek modelin kullanabileceği büyüklükte parçalar oluşturulur. Her parça için anlam aramasında kullanılacak sayısal bir temsil üretilir; özgün metin, kaynak kimliği, konum ve sürüm bilgisiyle birlikte saklanır.

Bir bölüm sınırı ancak o ana kadar biriken metin 250 token'ı aşmışsa yeni parça açar. Bu, bir başlığın tek başına kısa bir giriş cümlesi olduğu durumlarda cevabın parçalanmasını engeller. Ölçülen medyan parça büyüklüğü bu değişiklikle 143'ten 362 token'a çıktı; kısa giriş cümleleri artık ayrı parça olarak aramaya girmiyor.

Her parçanın içeriği, üzerinde bulunduğu başlık yoluyla birlikte hem sayısal temsile hem tam metin dizinine yazılır. Parçalama kuralları değiştiğinde hattın sürüm numarası artar; eski parçaların yeni hattan gelen bir içerikle karışmaması bu sayede garanti edilir.

Embedding bir eğitim işlemi değildir. Metni benzer anlamdaki sorgularla karşılaştırmaya yarayan bir gösterime dönüştürür. Kullanılan temsil modeli her çağrıda okunur. Orijinal RAG çalışması, harici bilginin üretim sırasında geri getirilmesine dayanan yaklaşımın temelini açıklar.

Güncelleme

Yeni sürüm tamamen hazırlanıp yayımlanana kadar önceki başarılı sürüm kullanılabilir kalır. Bu yaklaşım, başarısız bir taramanın çalışan bilgi tabanını yarım içerikle değiştirmesini önler.

Eşitleme yeniden çalıştırılabilir: içerik değişmemişse hiçbir şey yeniden gömülmez. Bir kaynağın erişilemez hâle geldiği durumda, hata üretmeye devam etmemesi için otomatik yenileme 24 saat bekletilir. Aksi hâlde sürekli erişilemeyen bir site iş kuyruğunu doldurup ücret üretir.

Eşitleme sonrası değişen sorular yeniden denenmeli; kaynak hazır olması cevabın iş ihtiyacını karşıladığını tek başına kanıtlamaz.

On this page