Le RAG (Retrieval-Augmented Generation) rend une IA utile sur TES données. Au lieu de répondre depuis ses poids, elle recherche dans ta base, puis génère.
1. Chunker tes documents
Découpe ton texte en morceaux de ~500 tokens avec overlap (~50). Évite de tronquer le sens.
2. Embedding
Transforme chaque chunk en vecteur. Modèles FR : text-embedding-3-small (OpenAI) ou multilingual-e5. Coût ~0,02$/1M tokens.
3. Vector store
Stocke les vecteurs (PgVector, Qdrant, Pinecone). Pour démarrer, PgVector suffit — pas de nouveau service.
4. Recherche + génération
Embed la question, recherche 5 chunks proches (cosine), injecte-les dans le prompt système. Limite à 3-4 chunks pour contrôler le coût.
Coût réel
Sur 1000 docs de 500 tokens : embedding ~0,01$, puis ~0,30$/1M tokens génération. RAG = quelques centimes par requête.
Conclusion
Le RAG FR est accessible. Une API unifiée gère embedding + génération en un seul appel.
💡 Templates NeuraAPI | prompts Prompt Empire.