Transformer'lar

Transformer'lar


Transformer'lar, dizileri işlemek için tasarlanmış ve bugünkü dil modellerinin neredeyse tamamının üzerine kurulduğu sinir ağı mimarisidir. 2017'de "Attention Is All You Need" makalesiyle tanıtıldı. Kendisinden önceki tekrarlayan sinir ağlarından ayrıldığı nokta şu: metni baştan sona tek tek okumak yerine, tüm token'lara aynı anda bakabiliyor.

Bunu mümkün kılan mekanizma self-attention. Her token, dizideki diğer tüm token'lara ne kadar dikkat etmesi gerektiğini hesaplıyor. "Banka kenarında oturduk" cümlesinde "banka" kelimesinin anlamını "kenarında" ve "oturduk" belirliyor, model de ağırlığı oraya veriyor. Katmanlar üst üste bindikçe temsiller daha soyut hâle geliyor. Sıra bilgisi ayrıca pozisyon kodlamasıyla ekleniyor, çünkü mekanizmanın kendisi sırayı bilmiyor.

Mimari encoder ve decoder olmak üzere iki bloktan oluşuyor. BERT gibi modeller yalnızca encoder tarafını kullanıp anlama görevlerine odaklanıyor, GPT ailesi yalnızca decoder tarafını kullanıp üretim yapıyor, çeviri modelleri ise ikisini birlikte kullanıyor.

Paralel çalışabilmesi pratik sonucu belirledi. Tüm token'lar aynı anda işlendiği için eğitim GPU'lara dağıtılabiliyor, bu da çok daha büyük veri ve çok daha büyük modelleri mümkün kıldı. Metnin yanı sıra görüntü, ses ve kod alanlarında da aynı mimari kullanılıyor.

Maliyeti dikkat mekanizmasının kendisinde. Hesap dizi uzunluğunun karesiyle büyüdüğü için uzun bağlam pahalıya mal oluyor, bu da bağlam penceresi sınırlarının teknik nedeni.

Özel yapay zekâ modellerinden kurumsal danışmanlık ve arama deneyimlerine kadar projenize güç katın.
Yapay zekâ ekibimizle tanışın