Konu Modelleme

Konu Modelleme


Konu modelleme, etiketlenmemiş bir metin yığınının hangi konu kümelerinden oluştuğunu istatistiksel olarak ortaya çıkaran bir yöntemdir. Kimse önceden bir konu listesi vermiyor. Yöntem, hangi kelimelerin aynı belgelerde birlikte görünme eğiliminde olduğuna bakıyor ve bu birlikteliklerden konu adayları çıkarıyor.

Klasik yaklaşım LDA. Her belgeyi birkaç konunun karışımı, her konuyu da kelimeler üzerinde bir olasılık dağılımı olarak modelliyor. Çıktıda konu 3 gibi numaralı bir küme ve o kümenin en ağır kelimeleri geliyor. "kargo, teslimat, gecikme, kurye" listesini görüp bunun lojistik şikâyetleri olduğunu söylemek insana kalıyor. Daha yeni yaklaşımlar belgeleri embedding'lere çevirip vektör uzayında kümeliyor, bu da eşanlamlıları aynı konuya toplamayı kolaylaştırıyor.

Kullanım alanı, elle okunamayacak kadar büyük metin yığınları. Müşteri destek kayıtları, uygulama mağazası yorumları, anket açık uçlu cevapları, sosyal medya paylaşımları ve büyük içerik arşivleri bu kapsama giriyor.

Somut bir örnek: 60 bin destek talebi üzerinde konu modelleme çalıştırıldığında, taleplerin dörtte birinin fatura ve ödeme başlığında toplandığı ortaya çıkıyor. Bu bilgi hem yardım merkezinde eksik olan içeriği, hem de üründe düzeltilmesi gereken adımı işaret ediyor.

Sonuçlar deterministik değil. Konu sayısı elle seçildiği için, aynı veriye farklı parametrelerle bakıldığında farklı kümeler çıkabiliyor. Bu yüzden çıktı doğrudan rapora aktarılmadan önce örnek belgelerle kontrol ediliyor.

Özel yapay zekâ modellerinden kurumsal danışmanlık ve arama deneyimlerine kadar projenize güç katın.
Yapay zekâ ekibimizle tanışın