Maia Bazerji

EvalRAG Framework

Open-source evaluation framework for production RAG systems with automated regression detection Framework d'évaluation open-source pour les systèmes RAG en production avec détection automatique des régressions

View on GitHub → Voir sur GitHub →

Problem: Evaluating RAG in Production Problème : Évaluation des RAG en Production

Production RAG systems are hard to evaluate. Deploying an optimization looks good in testing but degrades performance on real-world queries. Most teams rely on manual evaluation or naive accuracy metrics that miss latency, token cost, and hallucination risks. Les systèmes RAG en production sont difficiles à évaluer. Déployer une optimisation semble bon en test mais dégrade les performances sur les requêtes du monde réel. La plupart des équipes s'appuient sur l'évaluation manuelle ou des métriques de précision naïves qui manquent la latence, le coût du jeton et les risques d'hallucination.

Solution: Evaluation Pipeline Solution : Pipeline d'Évaluation

RAG Evaluation Pipeline RAG Input Prompts & Queries LLM Generation Outputs from Multiple Strategies Metric Evaluation Accuracy, Latency, Cost Regression Detection A/B Testing Statistical Sig. Feedback Loop Alerts & Reports 3 Retrieval Strategies Compared Classic Vector Search + LLM Reranking Fast Cost-effective Baseline Graph Knowledge Graph Multi-hop Reasoning Complex queries Higher latency Better reasoning Agentic Claude + Tool Use Iterative Retrieval Most accurate Highest cost Adaptive flow Evaluation Metrics Relevance & Completeness Latency (p50, p95, p99) Token Cost Hallucination Rate

How It Works Comment Cela Fonctionne

Evaluation Metrics Métriques d'Évaluation

Comparative Dashboard Tableau de Bord Comparatif

Results Résultats

3
Strategies TestedStratégies Testées
Production
StatusStatut
MIT License
Open SourceSource Ouverte

Technology Stack Stack Technologique

Python FastAPI React Qdrant PostgreSQL Redis LangChain Claude API Docker