Méthode
Un pipeline construit pour ne pas inventer
01 Collecter → PDFs, Google Docs, bases existantes
02 Filtrer → Chunking sémantique, catégories, métadonnées
03 Ancrer → Silence plutôt qu'invention. Seuil de refus configuré
04 Contrôler → Score de confiance sur chaque sortie
05 Connecter → Assistance, rédaction, publication automatisée
Le seuil de refus
Chaque fragment récupéré reçoit un score entre 0 et 1. En dessous du seuil configuré, il est écarté automatiquement. Le modèle ne reçoit que ce qui dépasse le seuil.
Fragment A ████████████████████ 0.84 ✓
Fragment B ████████████ 0.61 ✓
Fragment C ███████ 0.38 ✗ ← écarté
Seuil par défaut : 0.50
Sources d'ingestion
| Source | Fonctionnement |
|---|---|
| Google Drive | Sync automatique via webhook, mise à jour à chaque modification |
| GitHub | Indexation du code à chaque commit |
| Upload direct | PDF, MD, TXT, JSON jusqu'à 100 MB (PRO) |
| Claude MCP | retriv dans claude.ai sans installation |
Performance
| Opération | Temps |
|---|---|
| Recherche sémantique | 100–300 ms |
| Réponse RAG complète | 2 à 8 secondes |
| Réduction coût tokens | ~97% |
Stack technique
| Composant | Rôle |
|---|---|
| Next.js 16 | Interface et API routes |
| Qdrant | Base vectorielle — recherche sémantique |
| PostgreSQL + Prisma | Données utilisateurs et corpus |
| Ollama | Embeddings locaux (mxbai-embed-large) |
| FastAPI | Extraction et reranking |
| Neo4j | Graphe de relations (GraphRAG) |
| Docker | Infrastructure conteneurisée |
| OVH Cloud | Hébergement souverain France |
GraphRAG — extension en cours
En complément du RAG vectoriel, retriv intègre une couche GraphRAG via Neo4j.
L'utilisateur dépose un fichier d'ontologie (markdown naturel) dans son corpus. retriv extrait automatiquement les entités et relations, les stocke dans Neo4j, et les croise avec les chunks Qdrant à chaque requête.
Ce que ça apporte :
- Réponses multi-hop (A est lié à B qui est lié à C)
- Chemin de preuve visible dans les sources
- Cohérence relationnelle sur des corpus complexes
→ Voir GraphRAG pour le détail.
Modèles LLM disponibles
| Modèle | Hébergement | Usage recommandé |
|---|---|---|
| gpt-oss-20b | OVH France 🇫🇷 | Usage général, souverain |
| Mistral Small | France 🇫🇷 | Données sensibles |
| DeepSeek V3 | Chine 🇨🇳 | Coût minimal |
| Claude Haiku | USA 🇺🇸 | Qualité élevée |