SaaS ऐप में RAG रिट्रीवल गुणवत्ता का मूल्यांकन कैसे करें
प्रतिनिधि प्रश्नों, सही दस्तावेज़ के लेबल, रैंकिंग मेट्रिक्स, स्रोत-आधारित उत्तर जाँच और टेनेंट-सचेत परीक्षणों से RAG रिट्रीवल और उत्तर की गुणवत्ता मापें।
इस मार्गदर्शिका में
RAG रिट्रीवल गुणवत्ता कैसे मापें?
Retrieval-augmented generation (RAG) को दो चरणों में परखें: पहले देखें कि रिट्रीवल सही और अधिकृत प्रमाण लाता है या नहीं, फिर जाँचें कि उत्तर उस प्रमाण का सही उपयोग करता है या नहीं। सहज भाषा वाला उत्तर रिट्रीवल की गलती छिपा सकता है; और प्रासंगिक अंश से भी बिना आधार का उत्तर बन सकता है। अपेक्षित स्रोतों वाले वास्तविक प्रश्नों का दोहराया जा सकने वाला सेट बनाएँ और embeddings, chunking, फ़िल्टर, रैंकिंग या प्रॉम्प्ट बदलने से पहले दोनों चरण अलग मापें।
अपेक्षित प्रमाण वाला प्रश्न सेट बनाएँ
सामान्य प्रश्न, दूसरे शब्दों में पूछे गए प्रश्न, आगे के सवाल, गलत वर्तनी, हिंदी-अंग्रेज़ी रूप, अस्पष्ट प्रश्न और ऐसे सवाल शामिल करें जिनका उत्तर कॉर्पस में नहीं है। जवाब योग्य हर प्रश्न के लिए बताएँ कि कौन-सा दस्तावेज़ या अंश मिलना चाहिए और क्यों; बिना उत्तर वाले मामले में अनुपलब्ध प्रमाण पर रुकना अपेक्षित रखें। उदाहरण निजता-जाँच के बाद रखें और कॉर्पस संस्करण दर्ज करें।
जनरेट किए पाठ को जाँचने से पहले रिट्रीवल मापें
देखें कि अपेक्षित प्रमाण शीर्ष k नतीजों में आया और उसकी रैंक क्या थी। Precision@k और recall@k अप्रासंगिक नतीजे तथा छूटे प्रमाण दिखाते हैं; reciprocal rank या normalized discounted cumulative gain परिणाम की स्थिति को भी माप सकते हैं। k और स्वीकार्य सीमा उत्पाद के उपयोग के अनुसार चुनें, सार्वभौमिक बेंचमार्क से कॉपी न करें।
देखें कि उत्तर मिले प्रमाण पर आधारित है या नहीं
जाँचें कि महत्वपूर्ण दावे प्राप्त अंशों से निकलते हैं, उत्तर प्रश्न पूरा करता है और उद्धरण सहायक स्रोत तक पहुँचाता है। जहाँ संभव हो निश्चित जाँच लगाएँ और सूक्ष्म निर्णय में मानव से कैलिब्रेट रूब्रिक इस्तेमाल करें। RAG मूल्यांकन फ्रेमवर्क context precision, context recall और faithfulness जैसे माप देते हैं, पर हर माप की मान्यताएँ होती हैं; उन्हें अपने काम पर परखें।
| प्रश्न और भाषा | अपेक्षित स्रोत/अंश | मिले शीर्ष-k नतीजे | रिट्रीवल/उत्तर स्कोर | विफलता और अगला कदम |
|---|---|---|---|---|
SaaS RAG परीक्षण सेट में क्या-क्या होना चाहिए?
कॉर्पस की ताज़गी, गायब प्रमाण और कठिन मेल जाँचें
हाल में बदले और समाप्त दस्तावेज़, दोहराए या टकराते अंश, कई अर्थ वाले छोटे प्रश्न और ऐसे प्रश्न रखें जिनके लिए एक से अधिक स्रोत जोड़ने पड़ें। उत्तर नहीं वाले मामले भी जोड़ें ताकि सिस्टम को हर बार उत्तर देने पर अंक न मिलें। हर रन में कॉर्पस संस्करण, इंडेक्स निर्माण और रिट्रीवल कॉन्फ़िगरेशन दर्ज करें।
प्राधिकरण और टेनेंट अलगाव को अनिवार्य जाँच बनाएँ
हर प्रश्न के लिए देखें कि लौटाया हर अंश अधिकृत टेनेंट का है और मौजूदा उपयोगकर्ता उसे देख सकता है। अनुमानित ID, रद्द पहुँच, बदली भूमिका, दूसरे टेनेंट से टकराव और कैश हिट जाँचें। प्रासंगिकता स्कोर अनधिकृत प्रमाण को सही नहीं बनाता; पहुँच नियंत्रण को गुणवत्ता मेट्रिक्स से अलग जाँचें और सीमा उल्लंघन पर रिलीज़ रोकें।
भाषा, उपयोग और असर के अनुसार नतीजे अलग देखें
जहाँ जरूरी हो भाषा, दस्तावेज़ प्रकार, प्रश्न उद्देश्य और अधिक प्रभाव वाले काम के अनुसार परिणाम बाँटें। विषय-विशेषज्ञ समीक्षक देखें कि स्रोत उपयोगी हैं और उत्तर में जरूरी सीमाएँ बनी हैं। नमूने का आकार और विफलता रिपोर्ट करें; कुल रिट्रीवल स्कोर एक भाषा या छोटे महत्वपूर्ण उपयोग की खराब स्थिति छिपा सकता है।
इंडेक्स या मॉडल बदलने के बाद RAG मूल्यांकन कैसे चलाएँ?
समस्या खोजते समय एक बार में एक परत बदलें
विफलता समझने के लिए ingestion, chunking, embedding, फ़िल्टर, reranking और generation को अलग-अलग मिलाएँ। सब कुछ एक साथ बदलने पर स्कोर का कारण समझना कठिन है। जिन मामलों की रैंक या उत्तर काफी बदला, उनके पहले और बाद के नतीजे सुरक्षित रखें।
दोहराने योग्य तुलना के लिए वही प्रश्न सेट चलाएँ
रिलीज़ तुलना के लिए संस्करणयुक्त मुख्य प्रश्न सेट रखें और नए ट्रैफिक तथा हाल की विफलताओं के लिए बदलता सेट जोड़ें। प्रदाता-विशिष्ट सर्च मूल्यांकन टूल कुछ डेटा-स्टोर विन्यास पर सीमित हो सकते हैं; उनकी सीमाएँ जाँचें और अपेक्षित प्रश्न व स्रोतों की पोर्टेबल प्रति रखें।
समीक्षा के बाद प्रोडक्शन विफलता को परीक्षण में बदलें
सहायता रिपोर्ट, कम रेटिंग और सुरक्षित परिचालन संकेत से छूटे या अप्रासंगिक प्रमाण खोजें। मामले की समीक्षा करें, गैर-ज़रूरी निजी डेटा हटाएँ और अपेक्षित स्रोत या उत्तर न देने के व्यवहार के साथ सही सेट में जोड़ें। हर सुधार को सच मानकर स्वतः न डालें; प्रमाण जाँचें और मूल्यांकन सेट को डेटा विषाक्तता से बचाएँ।
RAG रिट्रीवल गुणवत्ता के आम सवाल
रिट्रीवल गुणवत्ता और उत्तर गुणवत्ता में क्या अंतर है?
रिट्रीवल गुणवत्ता मापती है कि सिस्टम प्रासंगिक और अधिकृत प्रमाण ढूँढ़ता है या नहीं। उत्तर गुणवत्ता मापती है कि जनरेट हुआ जवाब उस प्रमाण का सही उपयोग कर उपयोगकर्ता का काम पूरा करता है या नहीं। दोनों चरण जाँचें।
RAG सर्च जाँचने में कौन-से मेट्रिक उपयोगी हैं?
Precision@k और recall@k नतीजों में प्रासंगिकता और कवरेज मापते हैं; reciprocal rank या nDCG जैसे मेट्रिक रैंक भी देखते हैं। groundedness और answer relevance जनरेशन मापते हैं। उपयोग के अनुसार माप चुनें और समीक्षा किए उदाहरणों पर उन्हें मान्य करें।
क्या LLM जज RAG groundedness के लिए काफी है?
नहीं। स्वचालित स्कोर की तुलना मानव-समीक्षित मामलों से करें, मतभेद देखें और स्रोत पहचान या उद्धरण जैसी सटीक शर्त सीधे जाँचें। जज का स्कोर अपूर्ण संकेत है।
क्या ऊँचा RAG स्कोर टेनेंट अलगाव साबित करता है?
नहीं। विरोधी टेनेंट-सीमा मामलों से पहुँच नियंत्रण अलग जाँचें। प्रासंगिकता या उत्तर स्कोर यह साबित नहीं करता कि मिले दस्तावेज़ अधिकृत थे।
संबंधित व्यावहारिक मार्गदर्शिकाएँ
संबंधित मुद्दों की मार्गदर्शिकाएँ
स्रोत और प्रकाशन रिकॉर्ड
मसौदा 27 सितंबर 2026 को तैयार; इंजीनियरिंग, सुरक्षा और संपादकीय समीक्षा लंबित · स्रोत जाँचे गए .
- Evaluate search quality
- RAGAs: Automated Evaluation of Retrieval Augmented Generation
- Evaluation best practices
- OpenAI API deprecations
- Evaluation best practices
- Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (NIST AI 600-1)
- AWS SaaS Lens: multi-tenant SaaS की विश्वसनीयता का परीक्षण
- LLM04:2025 Data and Model Poisoning
- OWASP Cheat Sheet: logging