RAG System
Open-source evaluation framework for production RAG systems with automated regression detection
3retrieval strategies
11test modules
CIruff / mypy / pytest
Problem: Evaluating RAG in Production
Production RAG systems are hard to evaluate. Deploying an optimization looks good in testing but degrades performance on real-world queries. Most teams rely on manual evaluation or naive accuracy metrics that miss latency, token cost, and hallucination risks.
Solution: Evaluation Pipeline
How It Works
- Test 3 retrieval strategies on your RAG system
- Measure accuracy, latency, and cost for each strategy
- Detect regressions before deploying to production
- Get automated alerts on quality drops or cost spikes
Evaluation Metrics
- Automated metrics: relevance, completeness, latency, token cost
- LLM-as-judge: qualitative scoring with Claude
- Regression detection: A/B testing with statistical significance
- Audit trail: Full traceability for compliance
Comparative Dashboard
- React frontend for real-time visualization
- Side-by-side comparison of all strategies
- Deep-dive into latency, tokens, reasoning traces
- Export & reporting for stakeholders
Results
3
Strategies Tested
Production
Status
MIT License
Open Source
- Automated regression detection before user impact
- Data-driven strategy selection per query class
- Community contribution: helps teams build better RAG systems
- Multi-dimensional evaluation: latency, cost, and quality
Technology Stack
Python
FastAPI
React
Qdrant
PostgreSQL
Redis
LangChain
Claude API
Docker