EvalRAG Framework
Open-source evaluation framework for production RAG systems with automated regression detection
Framework d'évaluation open-source pour les systèmes RAG en production avec détection automatique des régressions
Problem: Evaluating RAG in Production
Problème : Évaluation des RAG en Production
Production RAG systems are hard to evaluate. Deploying an optimization looks good in testing but degrades performance on real-world queries. Most teams rely on manual evaluation or naive accuracy metrics that miss latency, token cost, and hallucination risks.
Les systèmes RAG en production sont difficiles à évaluer. Déployer une optimisation semble bon en test mais dégrade les performances sur les requêtes du monde réel. La plupart des équipes s'appuient sur l'évaluation manuelle ou des métriques de précision naïves qui manquent la latence, le coût du jeton et les risques d'hallucination.
Solution: Evaluation Pipeline
Solution : Pipeline d'Évaluation
RAG Evaluation Pipeline
RAG Input
Prompts &
Queries
LLM Generation
Outputs from
Multiple Strategies
Metric
Evaluation
Accuracy, Latency,
Cost
Regression
Detection
A/B Testing
Statistical Sig.
Feedback Loop
Alerts &
Reports
3 Retrieval Strategies Compared
Classic
Vector Search
+ LLM Reranking
Fast
Cost-effective
Baseline
Graph
Knowledge Graph
Multi-hop Reasoning
Complex queries
Higher latency
Better reasoning
Agentic
Claude + Tool Use
Iterative Retrieval
Most accurate
Highest cost
Adaptive flow
Evaluation Metrics
Relevance &
Completeness
Latency (p50, p95, p99)
Token Cost
Hallucination Rate
How It Works
Comment Cela Fonctionne
Test 3 retrieval strategies on your RAG system Testez 3 stratégies de récupération sur votre système RAG
Measure accuracy, latency, and cost for each strategy Mesurez la précision, la latence et le coût pour chaque stratégie
Detect regressions before deploying to production Détectez les régressions avant le déploiement en production
Get automated alerts on quality drops or cost spikes Recevez des alertes automatiques sur les baisses de qualité ou les pics de coûts
Evaluation Metrics
Métriques d'Évaluation
Automated metrics: relevance, completeness, latency, token cost Métriques automatisées : pertinence, complétude, latence, coût du jeton
LLM-as-judge: qualitative scoring with Claude LLM-as-judge : notation qualitative avec Claude
Regression detection: A/B testing with statistical significance Détection des régressions : tests A/B avec significativité statistique
Audit trail: Full traceability for compliance Piste d'audit : Traçabilité complète pour la conformité
Comparative Dashboard
Tableau de Bord Comparatif
React frontend for real-time visualization Frontend React pour la visualisation en temps réel
Side-by-side comparison of all strategies Comparaison côte à côte de toutes les stratégies
Deep-dive into latency, tokens, reasoning traces Approfondissement de la latence, des jetons, des traces de raisonnement
Export & reporting for stakeholders Export et rapports pour les parties prenantes
Results
Résultats
3
Strategies Tested Stratégies Testées
MIT License
Open Source Source Ouverte
Automated regression detection before user impact Détection automatique des régressions avant l'impact utilisateur
Data-driven strategy selection per query class Sélection de stratégie basée sur les données par classe de requête
Community contribution: helps teams build better RAG systems Contribution communautaire : aide les équipes à construire de meilleurs systèmes RAG
Multi-dimensional evaluation: latency, cost, and quality Évaluation multidimensionnelle : latence, coût et qualité
Technology Stack
Stack Technologique
Python
FastAPI
React
Qdrant
PostgreSQL
Redis
LangChain
Claude API
Docker