Üç ay əvvəl bir CTO aylıq süni intellekt hesabına baxıb harada səhvə yol verdiyini düşünürdü. Komandası çox gözəl LLM pipeline'ı qurmuşdu — prodakşn-ready, observability tanısı qoyulmuş, hər şey yerli-yerində. Sonra fakturalar gəlməyə başladı və məlum oldu ki, o, əslində bir pul sobası inşa edib. Token istehlakı həftədə 3 dəfə artırdı, 429 xətaları hər yerdə idi, latens isə şirkət daxilində zarafata çevrilmişdi.
Çıxış yolu nə idi? Tək bir modelə güvənmək deyil, ağıllı marşrutlaşdırma qatı qurmaq. Müəllif üç qatlı arxitektura tətbiq edib: sorğunun mürəkkəbliyinə görə düzgün modeli seçən marşrutlaşdırma, ümumi nümunələri aqressiv şəkildə keşləyən təbəqə və bir şey sındıqda zərif şəkildə geri çəkilən fallback mexanizmi. Nəticədə OpenAI'dən DeepSeek V4 Pro-ya keçərək giriş tokenlərində təxminən 4.5 dəfə, çıxış tokenlərində də eyni nisbətdə ucuzlaşma əldə edib.
Xüsusi marşrutlaşdırma üçün sadəcə OpenAI SDK-nı vahid bir endpoint'ə yönləndirmək kifayət edib. İmplementasiya 20 dəqiqə çəkib və junior mühəndis həmin gün içərisində feature'lər göndərməyə başlayıb. Keşləmə strategiyası isə daha dərin: promptun dəyişən hissəsinin embedding'ini saxlayan semantik keş 40% hit rate verir ki, bu da effektiv token xərclərini üçdə bir azaldır.
Maraqlıdır ki, hər sorğu üçün ən güclü modeli işə salmaq lazım deyil. Sadə sorğular — məsələn, “sifariş nömrəsi 12345 nə vəziyyətdədir?” — üçün ucuz və sürətli modellər kifayətdir. Bu yanaşma ilə 50% qənaət əldə etmək mümkündür və istifadəçilər keyfiyyət fərqini hiss etmir. Nəticədə həmin startap indi ayın sonunda “bu faktura bizi öldürəcək” demək əvəzinə “bu, əslində idarəolunandır” fikrindədir.
Bir də vacib məqam: yalnız xərcə fokuslanmaq keyfiyyəti aşağı sala bilər. Müəllif yüngül keyfiyyət monitorinqi qurub — prodakşn trafikinin 1%-ni nümunə götürüb daha böyük bir modellə qiymətləndirir. İstifadəçi məmnuniyyəti, latens və xəta nisbətləri izlənilir. Keyfiyyət sürüşəndə səhifəyə zəng gedir, xərc sürüşəndə isə sadəcə Slack mesajı. Fərqli ciddilik, fərqli reaksiya.
Mənbə: Dev.to (https://dev.to/eagerspark/how-i-stopped-burning-cash-on-token-limits-a-ctos-field-notes-lgp)



