Prompt Caching

Prompt Caching


Production prompt'ları kendini tekrar eder. Aynı sistem talimatları, aynı araç tanımları, aynı örnekler her istekte yeniden gider ve yalnızca kullanıcının son mesajı değişir. Bu sabit bloğu her seferinde yeniden işlemek, sağlayıcının zaten yapmış olduğu işi tekrarlamaktır.

Prompt caching bir önekin attention durumunu saklar ve yeniden kullanır. Aynı önekle başlayan bir sonraki istek o bölüm için prefill'i atlar ve hesaplamaya ilk farklı token'dan başlar. Sağlayıcılar önbellekli girdiyi taze girdinin belirgin şekilde altında fiyatlandırır. Uzun öneklerde latency kazancı çoğu zaman maliyet kazancından da büyüktür.

Davranışın prompt yazımını şekillendiren tek bir kuralı var. Eşleşme prompt'un başından itibaren yapılır, dolayısıyla değişken olan her şey sabit olan her şeyin altına inmelidir. Sistem prompt'unun en üstündeki bir zaman damgası önbelleği her çağrıda geçersiz kılar. Sabit bloğun altına aldığınızda önbellek tutar.

Önbellek kayıtları hızlı düşer, genelde birkaç dakikalık hareketsizlikte silinir. Kazanç bu yüzden seyrek isteklerde değil sürekli trafikte görünür.

Ölçüm yaparken sağlayıcının yanıtındaki önbellek alanlarına bakmak gerekir. Çoğu API, kaç token'ın önbellekten okunduğunu ve kaçının yeniden işlendiğini ayrı ayrı raporlar. Beklediğinizden düşük bir isabet oranı görüyorsanız, prompt'un başında sessizce değişen bir alan vardır. Genelde suçlu bir zaman damgası, bir oturum kimliği ya da sıralaması değişen bir araç listesidir.

Özel yapay zekâ modellerinden kurumsal danışmanlık ve arama deneyimlerine kadar projenize güç katın.
Yapay zekâ ekibimizle tanışın