Automated Application Catalogue, Kabeen

Système de génération augmentée par récupération & ETL prêt pour la production

100k+documents
−80 %temps de traitement
ProductionGCP

Problème

Kabeen RAG and ETL pipeline Application sources are scraped, validated, classified and enriched with metadata, embedded into Qdrant, then served through hybrid retrieval and an LLM behind a FastAPI service on GCP. Application sources SCRAPING ETL + validation DATA QUALITY Classification METADATA EXTRACTION Embeddings CHUNKING Qdrant VECTOR STORE 100k+ ENTRIES Hybrid retrieval DENSE + LEXICAL LLM CLASSIFY / ANSWER FastAPI REAL-TIME SYNC Front end CATALOGUE UI GCP DOCKER / CLOUD RUN INGEST SERVE
Ingestion en haut, service en bas. Du scraping jusqu’à une API FastAPI sur GCP.

Le traitement manuel du catalogue était lent, coûteux et ne pouvait pas passer à l'échelle. Nécessité d'une classification automatisée et d'une extraction de métadonnées pour 100k+ documents applicatifs tout en maintenant la précision.

Solution

Pipeline RAG/ETL de bout en bout avec recherche vectorielle, réclassement, intégration LLM, validation des données et déploiement en production sur GCP

Résultats

80%
Réduction de latence
100k+
Documents
Alternance
Travail professionnel chez Kabeen

Stack Technologique

PythonFastAPILangChainQdrantPostgreSQLRedisClaude APIDockerGCP Cloud Run