Transformer, dizileri işlemek için tasarlanmış ve bugünkü dil modellerinin temelini oluşturan sinir ağı mimarisidir. 2017'de yayımlanan "Attention Is All You Need" makalesiyle tanıtıldı. Kendisinden önceki tekrarlayan ağlardan farkı, metni sırayla okumak yerine tüm token'lara aynı anda bakabilmesi.
Merkezinde self-attention duruyor. Her token, dizideki diğer token'lara ne kadar ağırlık vereceğini hesaplıyor ve temsilini bu ağırlıklara göre güncelliyor. Böylece bir kelimenin anlamı, cümlenin uzağındaki bir kelimeye bağlıysa bile yakalanabiliyor. Sıra bilgisi ayrı bir pozisyon kodlamasıyla ekleniyor, çünkü dikkat mekanizması tek başına sırayı bilmiyor.
Aynı anda çalışabilmesi, eğitimin GPU'lara dağıtılmasını mümkün kıldı. Bu da çok daha büyük veri ve çok daha büyük modellerin önünü açtı. Mimari bugün yalnızca metinde değil, görüntü, ses, kod ve protein dizilerinde de kullanılıyor.
Somut bir örnek: "Ali kitabı Ayşe'ye verdi, çünkü o çoktan okumuştu" cümlesinde "o" zamiri Ali'ye gönderme yapıyor. Sıralı okuyan bir model bu bağı uzaklık arttıkça kaybediyor, transformer ise iki kelimeyi doğrudan ilişkilendirebiliyor.
Maliyeti dikkat hesabında. Yük dizi uzunluğunun karesiyle büyüdüğü için uzun bağlam pahalı kalıyor, bu da bağlam penceresi sınırlarının arkasındaki teknik neden.


