Uzman Karışımı (Mixture of Experts)

Uzman Karışımı (Mixture of Experts)


Mixture of Experts mimarisinde tek bir yoğun katmanın yerini uzman adı verilen paralel alt ağlar alır. Küçük bir yönlendirici ağ her token'a bakar ve o token için en uygun iki ya da üç uzmanı seçer. Geri kalanlar o adımda hiç çalışmaz.

Bu seçicilik mimarinin bütün mantığıdır. 400 milyar parametreli yoğun bir model ürettiği her token için 400 milyar parametrenin tamamını çalıştırır. Aynı toplam boyuttaki bir MoE modeli 30 milyarını aktif eder. Token başına hesap yükü büyük ölçüde düşer, büyük parametre sayısının getirdiği kapasite ise korunur.

Bedeli bellek ve denge tarafında ödenir. Uzmanların hepsi çalışmasa bile bellekte durmak zorundadır, bu yüzden servis maliyeti yüksek kalır. Yönlendirici de eğitim sırasında birkaç favori uzmana kayma eğilimi gösterir. Eğitim buna karşı trafiği havuza yayan bir denge terimi ekler.

2024 sonrasında yayınlanan birçok sınır modeli bu tasarımı kullanıyor. Bir sağlayıcı "toplam" ve "aktif" parametre sayısını ayrı ayrı veriyorsa, model büyük ihtimalle MoE'dir.

Kendi kurulumunuzu planlarken bu ayrımın pratik karşılığı şudur: MoE modelleri token başına hızlı çalışır ama bellek tarafında yoğun modeller kadar yer ister. Tek GPU'ya sığdırma hesabı yaparken aktif parametre sayısına değil toplam parametre sayısına bakmak gerekir. Latency beklentisini ise aktif parametre belirler.

Özel yapay zekâ modellerinden kurumsal danışmanlık ve arama deneyimlerine kadar projenize güç katın.
Yapay zekâ ekibimizle tanışın