Rehber · Not 13

Arama, Geri Çağırma ve Semantik Retrieval

İyi retrieval tek bir arama kutusu değildir. Başlık, alias, metadata, tam metin, link ağı ve gerektiğinde semantik benzerlik birlikte çalışır; semantik arama diğer katmanların yerine geçmez.

Okuma
3 dk
Güncellendi
2026-09-26
Geri bağlantı
12
Kaynak
—

PKM'nin gerçek testi kaydetme anı değil geri dönüş anıdır

Bir bilgi sisteminin kalitesi, üç ay sonra belirli bir soruya cevap aradığında anlaşılır. Kaydı kolayca yaptığın halde geri bulamıyorsan sistem yalnız yazma deneyimini optimize etmiştir.

Kaynak modelinde klasik retrieval şu sırayla güçlenir:

  1. Başlık: Tanınabilir ve ayırt edici isim.
  2. Alias: Alternatif terimler ve eski isimler.
  3. Tag / metadata: Tür, durum, konu veya sahiplik filtresi.
  4. Full text: İçerik içinde kelime araması.
  5. [[ 14 - Backlink, Orphan ve Graph ile Ağ Sağlığı|Backlink ]] / [[ 11 - MOC, Wikilink ve Etiket Tasarımı|MOC ]]: Kavramın ağ içindeki yeri.

Bu katmanlar birlikte kullanıldığında kullanıcı dosya yolunu ezberlemek zorunda kalmaz.

Geri dönüşü tasarla

Bir not oluştururken yalnız “nereye kaydediyorum?” değil, “gelecekte bunu hangi ipucuyla arayacağım?” diye düşünmek faydalıdır. Bu ipucu başlık, proje bağlantısı, karar tarihi veya MOC olabilir.

Bütün retrieval'ı klasör ağacına yüklemek zayıftır; çünkü gelecekte hangi klasörü düşündüğünü hatırlaman gerekir. Çoklu sinyal kullanmak daha dayanıklıdır.

Semantik arama nerede güçlü?

Semantik arama aynı anlamın farklı kelimelerle ifade edildiği durumlarda değerlidir. Örneğin notta “bilgiye geri dönüş” yazarken sen “notları yeniden bulma” diye arayabilirsin. Embedding benzerliği bu farkı kapatabilir.

Fakat semantik benzerlik şunları kendi başına çözmez:

  • Hangi kaynağın kanonik olduğu.
  • Hangisinin güncel olduğu.
  • Aktif/proje durumunun ne olduğu.
  • Kaynak ile AI özetinin ayrımı.
  • Bir sonucun güven düzeyi.

Bu yüzden kaynak modelinin AI retrieval sırası daha güvenlidir:

Metadata filter → keyword → embedding → rerank → authority check.

Önce kapsamı yapılandırılmış sinyallerle daralt, sonra kelime ve semantik benzerliği kullan, sonunda kaynağın yetkisini/güncelliğini kontrol et.

Daha fazla sonuç daha iyi değildir

Retrieval'ın amacı mümkün olan en çok notu bulmak değil, görev için en doğru bağlamı kısa sürede getirmektir. Yüz benzer not döndürmek, on tanesinin aynı şablon cümleleri içermesi ve hangisinin kanonik olduğunun bilinmemesi arama kalitesini düşürür.

Bu nedenle duplicate truth ve seri üretilmiş tekrar içerik semantik arama için özellikle zararlıdır: benzerlik sistemi gürültüyü yüksek güvenle tekrar sunabilir.

Ölçülebilir sinyaller

  • Belirli bir bilgiye ulaşmak ne kadar sürüyor?
  • Arama sonuçlarının kaçı gerçekten ilgili?
  • Kullanıcı sık sık dosya yolunu elle dolaşmak zorunda mı?
  • Aynı sorguda birden fazla çelişkili “doğru” kaynak çıkıyor mu?
  • Semantik arama kanonik kaynağı üst sıralara getiriyor mu?

Retrieval hijyeni

Arama kalitesini artırmanın en etkili yolu bazen yeni arama aracı değil bilgi tabanını temizlemektir:

  • Belirsiz adları düzelt.
  • Duplicate truth'u birleştir.
  • Önemli orphan notları bağla.
  • Eski aktif kayıtları arşivle.
  • Kaynak ve türetilmiş özetleri ayır.

Bilgi ağı