RAG (Retrieval-Augmented Generation) sistemləri son vaxtlar süni intellekt tətbiqlərinin əsas komponentinə çevrilib. Ancaq əksər komandalar demo mərhələsində işləyən eyni sadə yanaşmanı — 512 tokenlik chunk, text-embedding-3-small modeli, top-k=5 — istehsal mühitinə daşıyanda problemlərlə üzləşirlər. Hüquqi sənədlər, API sənədləri və ya müştəri dəstək ticketləri kimi müxtəlif mətn tipləri eyni chunking strategiyası ilə işləmir və nəticədə həm dəqiqlik, həm də sürət zərər çəkir.
Dokument tipinə görə chunking
Müəlliflər vahid chunk əvəzinə dörd fərqli strategiya tətbiq ediblər: FixedToken (homogen məzmun üçün), Recursive (strukturu qoruyur — markdown başlıqları, kod blokları), Semantic (embedding oxşarlığı ilə təbii sərhədlər tapır) və Agentic (LLM özü qərar verir, bahalı ama ən keyfiyyətli). Hüquqi sənədlər üçün Recursive (1024 token, 100 overlap) recall@10=94% verir, API sənədləri üçün 768 tokenlə 96%, dəstək ticketləri üçün Semantic+conversation turns 91%, internal wiki üçün Agentic 97% təmin edir.
Hibrid axtarış və reranker
Təcrübə göstərib ki, təkcə vektor axtarışı dəqiq səhvləri (error kodları, funksiya adları) qaçırır, təkcə BM25 isə semantik uyğunluğu tutmur. Həll yolu: vektor axtarışı + BM25 paralel işləyir, nəticələr Reciprocal Rank Fusion ilə birləşdirilir, sonra cross-encoder reranker (50→5) 50ms əlavə vaxtla 15% recall artımı verir. Bi-encoder (embedding) oxşarlığı ilə relevans arasında korrelyasiya ~0.75, cross-encoder üçün ~0.92-dir.
Sorğu transformasiyası
İstifadəçilər sorğularını çox vaxt dəqiq ifadə etmir. Query transformer sorğunu genişləndirir: eyni məna, sinonimlər, daha geniş/dar versiyalar. Tək sorğu ilə recall@10=78%, 3 genişləndirilmiş sorğu ilə 94%, 5 ilə 96%. Bu 3-5x embedding çağırışı deməkdir, amma paralelləşdirmək olur.
Bayesian optimizasiya
Chunk ölçüsü, overlap, top_k, vektor/BM25 çəkiləri kimi hiperparametrlər adətən təsadüfi seçilir. Müəlliflər Optuna ilə 100 təcrübə aparıb, çoxməqsədli optimizasiya (recall maksimum, latensiya minimum) nəticəsində Pareto sərhədini əldə ediblər. Nəticə: 'Conservative' konfiq recall 91%, latensiya 180ms; 'Balanced' (prod) 95% recall, 320ms; 'Aggressive' 97% recall, 580ms. Hər ay yenidən işlətmək tövsiyə olunur.
Nəticələr
Bütün optimizasiyalardan sonra: recall@10 78%-dən 95%-ə (17 pp artım), latensiya p95 850ms'dən 320ms'ə (62% azalma), hallüsinasiya nisbəti 12%-dən 3%-ə, hər sorğunun dəyəri isə $0.008'dən $0.005'ə düşüb. Müəlliflər vurğulayır: “Retrieval infrastruktur, sonradan düşünülən bir şey deyil. Chunking strategiyaları kod kimi versiyalanmalı, qızıl dəst (golden dataset) ən qiymətli intellektual mülkünüzdür, hər dəyişiklik CI-da qiymətləndirilməlidir.”



