Semantik Benzerlik

Semantik Benzerlik


Semantik benzerlik, iki metin parçasının anlam bakımından ne kadar yakın olduğunu sayısal olarak ifade eder. Ortak kelime sayısına bakmıyor. "araba kiralama" ile "oto kiralama" tek bir kelimeyi paylaşmasa da anlamca neredeyse aynı, ölçü de bunu yakalamak zorunda.

Hesap embedding'ler üzerinden yapılıyor. Her metin, bir modelden geçirilerek yüzlerce boyutlu bir vektöre çevriliyor. Benzer anlamlar bu uzayda birbirine yakın düşüyor. İki vektör arasındaki açının kosinüsü alındığında sıfırla bir arasında bir skor çıkıyor, bir tarafa yaklaştıkça anlam yakınlığı artıyor. Ölçüm dilden bağımsız modellerle yapıldığında Türkçe bir cümle ile İngilizce karşılığı da yüksek skor alabiliyor.

Kullanım alanı geniş. Anlamsal arama, kopya ve yakın kopya içerik tespiti, destek taleplerinin mevcut çözüm makalelerine eşlenmesi, öneri sistemleri ve RAG akışında ilgili belgelerin getirilmesi hep bu skora dayanıyor.

Somut bir örnek: bir sitede 900 blog yazısı var ve içerik ekibi hangi yazıların birbirinin yerini tuttuğunu bilmiyor. Tüm yazılar embedding'e çevrilip ikili benzerlikler hesaplandığında, 0.9 üzerinde skor alan 40 çift ortaya çıkıyor. Bunlar birleştirme ya da yönlendirme adayı oluyor.

Skorun tek başına anlamı yok. Eşik değeri veri kümesine göre değişiyor, bu yüzden karar vermeden önce birkaç örnek elle okunarak eşiğin nereye oturduğu kontrol ediliyor.

Özel yapay zekâ modellerinden kurumsal danışmanlık ve arama deneyimlerine kadar projenize güç katın.
Yapay zekâ ekibimizle tanışın