Maksimum yanıt uzunluğu, bir modelin tek bir istek karşılığında üretebileceği en fazla token sayısıdır. Sınır kelimeyle değil token'la ölçülüyor, çünkü model metni token'lara bölerek işliyor. Türkçede bir kelime çoğu zaman birden fazla token'a karşılık geldiği için, aynı sınır Türkçe bir yanıtta İngilizceye göre daha az kelime demek.
Ayar API tarafında genelde max_tokens benzeri bir parametreyle veriliyor. Model bu sayıya ulaştığında üretimi durduruyor. Cümlenin ortasında kesilen yanıtların sebebi çoğu zaman doğal bir bitiş değil, bu tavan. Bağlam penceresiyle karıştırılmaması gerekiyor: bağlam penceresi istem ve yanıtın toplam bütçesi, maksimum yanıt uzunluğu ise bu bütçenin yalnızca çıktı tarafına ayrılan kısmı.
Sınırın iki pratik işlevi var. Maliyeti öngörülebilir tutuyor, çünkü ücretlendirme token üzerinden yapılıyor. Ayrıca uygulamanın kendi tasarım kısıtlarını koruyor. Ürün açıklaması üreten bir akışta 120 token'lık bir tavan, arayüzdeki kutuya sığmayan metinlerin baştan oluşmasını engelliyor.
Örnek olarak, bir e-ticaret sitesinde kategori metinlerini üreten bir entegrasyon düşünün. Tavan çok düşük ayarlandığında metinler yarım kalıyor, çok yüksek ayarlandığında model gereksiz uzun yazıyor ve token maliyeti artıyor. Ekipler bu yüzden tavanı önce birkaç örnek üzerinde ölçüp sonra sabitliyor.
Sınıra takılan yanıtlarda modelin bitiş nedeni de dönüyor. Bu alan kontrol edildiğinde, yanıtın kendi kendine mi bittiği yoksa kesilmiş mi olduğu ayırt edilebiliyor.

