AI agentləri işə salan komandaların tez-tez qarşılaşdığı problemlərdən biri gözlənilməz dərəcədə yüksək token xərcləridir. Bir çoxları bunu model təchizatçılarının baha qiymətlərinə bağlasa da, TokenLat mütəxəssislərinin fikrincə, əsl günahkar agentlərin memarlıq quruluşudur.
Məsələn, "2 dəqiqəlik" bir tapşırıq əslində agent tərəfindən 30-60 alət çağırışı tələb edir. Əksər freymvorklar isə hər çağırışa bütün söhbət tarixçəsini əlavə edir. Beləliklə, təxminən 4K token olaraq qiymətləndirilən bir iş, 40 çağırış × 8K kontekst = 320K tokenə çevrilir — və bu, ən bahalı modellərlə hesablanır.
TokenLat komandası həll olaraq trafiki ayırmağı təklif edir: 80% sadə tapşırıqlar (yönləndirmə, məlumat çıxarma, formatlama, təsnifat, xülasə) üçün səmərəli, daha ucuz modellərdən istifadə edin. Qalan 20% (mürəkkəb düşüncə, generasiya) üçün isə qabaqcıl model saxlanıla bilər. Bu yanaşma ilə ümumi xərc 70%+ azala bilər, keyfiyyət isə dəyişməz qalır.
Bir çox komandaların səhvi, dörd müxtəlif təchizatçı üçün dörd ayrı müştəri yazmaq və sadə bir marşrutlaşdırıcının onlar arasında "gəzməsinə" icazə verməkdir. Bu, keş itkisinə və kontekstin yenidən emalına səbəb olur. TokenLat'ın tövsiyəsi: OpenAI ilə uyğun bir endpoint istifadə edərək bütün modelləri bir kod yolu ilə idarə etmək. Beləliklə, keş lokalı qorunur və uğursuzluq yalnız ciddi xətalar zamanı baş verir.
Xüsusilə Malayziya və Cənub-Şərqi Asiya komandaları üçün uyğunluq da vacibdir. PDPA qaydalarına görə, məlumatların region daxilində saxlanması tələb olunur. TokenLat'ın gateway'i bu standartlara uyğun dizayn edilib.
Nəticə olaraq, agent xərclərini azaltmaq üçün model təchizatçısından endirim istəmək əvəzinə, memarlığı optimallaşdırmaq, marşrutlaşdırma və keşləmə strategiyaları tətbiq etmək daha effektivdir. Daha ətraflı məlumat üçün TokenLat'ın Discord serverinə qoşula və ya saytını ziyarət edə bilərsiniz.



