Özel bir agent ancak kontrol edilebilir tek iş, araç izinleri, durma koşulları, toparlanma yolları, görev izleri ve insan müdahalesi tek sınırlı döngüde birleştiğinde yayına hazırlanabiliyor.

Ekibinizin tarif edebildiği ve sonucunu kontrol edebildiği bir işle başlıyoruz. Agent'ın bu işi hangi adımlarla yürüttüğünü, nerede takıldığını, hatadan nasıl çıktığını ve ne zaman bir insana döndüğünü iz üzerinden inceliyoruz. Teslimde yayın sorumlunuz çalışan agent sürümünü, incelenmiş görev izlerini, açık araç yetkisini ve müdahale, geri alma ile toparlanma için ilk kullanım planını devralıyor.

Özel AI Agent Geliştirme illüstrasyonu: bir yapay zeka ajanının araçlarını ve karar sınırlarını test eden ekip

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • Defacto
  • Tosla
  • Neova Sigorta
  • Ajansspor
  • DLive
  • Amazon
  • BMW
  • Shell
  • Hyundai
  • PepsiCo
  • Red Bull
  • MediaMarkt
  • Decathlon
  • Trendyol
  • Hepsiburada
  • Sahibinden.com
  • Bayer
  • Sanofi
  • EY
  • KPMG
  • DenizBank
  • Acıbadem Sağlık Grubu
  • Abdi İbrahim
  • Yemeksepeti

Önce tek bir yolu baştan sona çalıştırıyoruz. Agent'a yeni bir araç, toparlanma seçeneği veya yayın koşulu eklemek için izlerde gerekçe arıyoruz.

  1. İşin yazılı sözleşmesi

    Girdiyi, kabul edilebilir sonucu, yasak aksiyonları, araçları, veriyi, maliyet ve latency bütçelerini, bilinen hataları ve istisnayı onaylayacak kişiyi birlikte belirliyoruz. Workflow sorumlunuz işin sınırını, kullanılabilecek araçları ve istisna yetkisini kesinleştiriyor.

  2. En kısa tamamlanmış yol

    Bir görevi girdiden sonuca taşıyacak hedef, durum, bellek, çıktının kaynakla desteklenmesi, araç sözleşmeleri, izinler ve durma koşullarını kuruyoruz. Test başlamadan önce araç ve izin sınırlarını mühendislik lideriniz onaylıyor.

  3. Görev yolundan çıktığında

    Temsili, uç ve olumsuz görevlerde tamamlanmayı, geçersiz aksiyonu, yinelenen yan etkiyi, takılan döngüyü, toparlanmayı, eskalasyonu, maliyeti ve latency'yi inceliyoruz. Hangi hata sınıflarıyla sınırlı yayına çıkılabileceğine güvenlik lideriniz karar veriyor.

  4. Kontrolleri işletecek ekip

    Yayın sınırlarını, izlemeyi, müdahaleyi, geri almayı ve işletim görevlerini incelenmiş izlerle birlikte teslim ediyoruz. Sınırlı yayın koşullarını ve durdurma yetkisini yayın sorumlunuz belirliyor.

Çalışan sürümün yanında, kapsamın aynı kalmasına, değişmesine veya genişlemesine karar verebilmeniz için gereken inceleme kanıtını da alırsınız.

  • Mimari dokümanı

    Agent döngüsü, durumları ve durma koşulları haritası

    Agent'ın hedefini, durumunu, döngüsünü, belleğini, çıktının kaynakla nasıl desteklendiğini, durma koşullarını, araç sınırlarını ve sorumluluk düzenini açıklar.

  • Matris

    Araç sözleşmeleri ve eskalasyon yetki kaydı

    Onaylı araçları ve şemaları, izinleri, insan onaylarını, yasak aksiyonları, kaynak bütçelerini ve eskalasyon yollarını gösterir.

  • Test kanıtı

    İncelenmiş görev izleri ve hata bulguları

    Tamamlama, geçersiz aksiyon, toparlanma, eskalasyon ve kaynak kullanımı için temsili, uç ve olumsuz görevleri incelenmiş izleriyle toplar.

  • Playbook

    İlk kullanım müdahale ve toparlanma planı

    İlk kullanım koşullarını, izlemeyi, müdahaleyi, geri almayı, toparlanmayı ve inceleme görevlerini kayda geçirir.

Başlangıç için en uygun iş, girdisi ve kabul edilebilir sonucu ekip tarafından bilinen, tekrar eden ve nasıl bozulabileceğine dair örnekleri bulunan iştir.

Şu durumlarda iyi bir seçim

  • İş birkaç adım ya da sistem arasında ilerliyor, bu yüzden tek bir prompt veya sabit kural artık yeterli olmuyor.
  • Temsili görevler ve hata örnekleri var, ama güvenli test ortamı ile gerekli araç ve veri erişimi henüz aynı sınırda buluşmuyor.
  • Yetki, maliyet, latency ve toparlanma kuralları farklı kişilerde kalıyor, bu yüzden agent'ın tek bir işletme sınırı bulunmuyor.
  • Tekrarlanan işin kabul edilebilir sonucu biliniyor, ama agent'ın durum, bellek, kaynak desteği, durma ve tamamlama döngüsü birlikte tanımlanmıyor.
  • Onaylı araçlar bulunuyor, ancak sözleşmeleri, izinleri, bütçe sınırları ve insana dönüş yolları tek bir yetki sınırında birleşmiyor.
  • Çalışan agent sürümü tanıdık görevleri tamamlıyor, ama izleri bilinen hataları ve kararlaştırılan toparlanma yollarını henüz kapsamıyor.
  • Uçtan uca görevler test edilebiliyor, ancak ilk kullanım sınırları, müdahale kontrolleri ve işletim görevleri yayın sorumlusuna bağlanmıyor.

Şu durumlarda başka bir çalışma daha doğru

  • Görevi, yetki tavanı ve bitiş koşulu tanımlanmadan genel amaçlı otonom çalışan istiyorsunuz. Bu seçimleri önce agent stratejisi netleştirmeli.
  • Agent'a kontrolleri incelenmeden yüksek etkili erişim veya geri alınamayan aksiyon vermek istiyorsunuz. Önce güvenlik tasarımı ve yetkilendirme gerekiyor.
  • Zeo'nun production'ı işletmesini, yeni veri edinmesini veya bu sürümün dışındaki entegrasyonları kurmasını istiyorsunuz. Bu işler ayrı kapsam gerektiriyor.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: AI agent hizmetini inceleyin

  • OpenAI

    En kısa çalışan agent döngüsünü OpenAI modelleri ve Agents SDK ile kuruyoruz

  • LangChain

    Agent döngüsündeki state'leri ve insan kontrol noktalarını LangGraph ile görünür kılıyoruz

  • Pydantic AI

    Hatalı agent çıktılarını Pydantic AI ile doğrudan sınırda durduruyoruz

  • Langfuse

    Agent'ın her adımını Langfuse trace'i üzerinden ayrıntılı biçimde inceliyoruz

  • Braintrust

    Hatalı ilerleyen agent yollarını Braintrust ile tekrar tekrar puanlıyoruz

  • Helicone

    Rollout kararında agent maliyetini ve latency'yi Helicone verileriyle değerlendiriyoruz

  • Guardrails AI

    Agent çıktı sözleşmesini rollout sonrasında Guardrails AI ile uyguluyoruz

Görevi, bilinen hata örneklerini ve sonuçtan sorumlu kişiyi getirin. En küçük tamamlanmış agent döngüsünü birlikte geliştirip test edelim.
İlk işi konuşalım

İlk agent geliştirmesi için ne kadar kapsam yeterli?

Bilinen girdisi, birinin kontrol edebileceği sonucu, temsili örnekleri, tanıdık hata biçimleri, gerekli en az araç ve verisi, politika sınırları, maliyet ve latency bütçeleri, ayrıca istisnayı onaylayacak kişisi olan tek bir iş yeterlidir.

Son cevabın göstermediği neyi agent izinde görürsünüz?

İz, her durum değişikliğini ve araç çağrısını gösteriyor. Geçersiz aksiyonu, yinelenen yan etkiyi, takılan döngüyü, dayanağı olmayan toparlanmayı, kaçırılan eskalasyonu ve faydalı ilerleme olmadan artan kaynak kullanımını buradan inceliyoruz. Agent'ın kendi özetine güvenmek zorunda kalmıyoruz.

Sınırlı yayından önce hangi koşullar karşılanmalı?

Üzerinde anlaştığımız görevler tamamlama kontrollerini geçmeli. Kritik hatalar doğru biçimde durmalı ya da eskale olmalı, operasyon ekibiniz agent'ı nasıl durduracağını ve geri alacağını bilmelidir. Kanıtı yayın sorumlunuz okur ve kararı verir.

Test setinde olmayan vakaları agent çözebilir mi?

Bunu garanti edemeyiz. Bazı tanımadığımız vakalar yeni istisnalara dönüşebilir. Modeller değişiyor. Sistemler güncelleniyor ve görevler test edilen davranışın dışına çıkabiliyor. Teslim ettiğimiz kanıt gerçekten çalıştırdığımız iş için geçerlidir.