NER Ordres de Mission

Système d'extraction d'entités en français avec fine-tuning CamemBERT

0,89F1 CamemBERT
0,84F1 spaCy
~5 mslatence en prod
Voir sur GitHub

Problème

Le traitement des ordres de mission nécessitait l'extraction manuelle des entités clés (lieu de départ, arrivée, dates, type de transport) à partir de texte français non structuré. C'était fastidieux, sujet aux erreurs et ne passait pas à l'échelle.

Solution

Deux modèles NER entraînés et comparés sur un corpus français annoté avec tagging BIO, puis mise en production de celui qui tenait la route :

Résultats & Métriques

12 000
Phrases d’entraînement
6
Types d'entités
0,84 / 0,89
F1 : spaCy vs CamemBERT
~5 / ~50 ms
Latence d’inférence
70/15/15
Partition Train/Val/Test

Stack Technologique

CamemBERT Hugging Face PyTorch spaCy Python seqeval JSON Flask

Apprentissages clés