RAG System

Framework d'évaluation open-source pour les systèmes RAG en production avec détection automatique des régressions

3stratégies
11modules de test
CIruff / mypy / pytest
Voir sur GitHub →
La vue Ask : trois stratgies de retrieval sur un mme corpus, le pipeline actif affich sous le slecteur.
EvalRAG · vue Ask

Problème : Évaluation des RAG en Production

Les systèmes RAG en production sont difficiles à évaluer. Déployer une optimisation semble bon en test mais dégrade les performances sur les requêtes du monde réel. La plupart des équipes s'appuient sur l'évaluation manuelle ou des métriques de précision naïves qui manquent la latence, le coût du jeton et les risques d'hallucination.

Solution : Pipeline d'Évaluation

RAG evaluation pipeline Questions enter the pipeline, are embedded and retrieved from the vector store, reranked, then answered by the LLM. Answers are scored by an LLM judge against a golden dataset, and a regression detector flags when a change degrades results. RAG Evaluation Pipeline RAG Input Prompts & Queries LLM Generation Outputs from Multiple Strategies Metric Evaluation Accuracy, Latency, Cost Regression Detection A/B Testing Statistical Sig. Feedback Loop Alerts & Reports 3 Retrieval Strategies Compared Classic Vector Search + LLM Reranking Fast Cost-effective Baseline Graph Knowledge Graph Multi-hop Reasoning Complex queries Higher latency Better reasoning Agentic Claude + Tool Use Iterative Retrieval Most accurate Highest cost Adaptive flow Evaluation Metrics Relevance & Completeness Latency (p50, p95, p99) Token Cost Hallucination Rate

Comment Cela Fonctionne

Métriques d'Évaluation

Tableau de Bord Comparatif

Résultats

3
Stratégies Testées
Production
Statut
MIT License
Source Ouverte

Stack Technologique

Python FastAPI React Qdrant PostgreSQL Redis LangChain Claude API Docker