← Retour au plan
Recherche avec vos propres documents : maîtriser les bases de connaissances · Leçon 7 sur 7

7. Dépannage, limites et bonnes pratiques

Gérez les documents en échec, comprenez les coûts en crédits d'embedding et les limites de documents, et appliquez les bonnes pratiques pour une récupération précise.

Lorsque vous téléversez un document dans une base de connaissances, il est découpé en fragments et indexé en arrière-plan. Une barre de progression suit le processus, et le document devient consultable une fois que son statut affiche « traité ». Cependant, certains documents peuvent échouer — généralement en raison de formats non pris en charge, de fichiers corrompus ou d'une taille excessive. Lorsque cela se produit, le statut d'échec apparaît à côté du document. Votre première étape consiste à retéléverser une version plus propre ou plus légère du fichier. Si plusieurs documents restent bloqués en état d'échec, votre administrateur peut déclencher un retraitement groupé depuis le panneau d'administration RAG. Vérifiez toujours quels types de fichiers votre administrateur a activés — la zone de téléversement rejettera les fichiers non pris en charge avec un message clair.

L'indexation de documents n'est pas gratuite : elle consomme des crédits d'embedding proportionnels à la taille du contenu traité. Les documents plus volumineux coûtent plus de crédits. En revanche, la recherche dans une base déjà indexée est légère et peu coûteuse. Votre offre et les paramètres administrateur plafonnent également le nombre maximal de documents par base de connaissances. Avant de constituer une base volumineuse, vérifiez vos crédits disponibles et les limites de documents pour éviter les mauvaises surprises en cours de projet. Si vous atteignez un plafond, envisagez de répartir le contenu entre plusieurs bases ciblées — cela améliore aussi la qualité de récupération.

La qualité de la récupération dépend de la façon dont vous organisez et découpez votre contenu. Les documents sont divisés en fragments (chunks) avant l'indexation ; des fragments plus grands préservent davantage de contexte par résultat, tandis que le chevauchement entre les fragments évite que les idées soient coupées aux limites. Les valeurs par défaut conviennent à la plupart des documents, mais vous pouvez les ajuster : augmentez la taille des fragments pour les textes longs et structurés (par exemple des contrats juridiques ou des manuels), et diminuez-la pour les contenus à réponses courtes comme les FAQ. L'organisation des bases est tout aussi importante — conservez une base de connaissances par sujet plutôt que de tout regrouper dans une seule base fourre-tout. Des bases ciblées renvoient des passages plus pertinents.

Astuce

Testez votre base de connaissances avec de vraies questions d'utilisateurs, pas seulement des mots-clés. Ouvrez le champ de recherche intégré sur la page de la base, saisissez une question naturelle et examinez les passages renvoyés. Si les résultats ne sont pas satisfaisants, ajoutez des documents plus pertinents ou revoyez vos paramètres de taille et de chevauchement des fragments.

Astuce

Si vous utilisez le mode d'import MCP, votre base se synchronise automatiquement avec l'intégration connectée. Cela signifie que le contenu reste à jour sans nouveaux téléversements manuels — mais aussi que des crédits d'embedding sont consommés à chaque fois qu'un contenu nouveau ou mis à jour est réindexé. Surveillez votre consommation de crédits en conséquence.

À vous de jouer

Ouvrez l'une de vos bases de connaissances et utilisez le champ de recherche intégré pour tester trois questions réelles que votre équipe poserait. Examinez les passages renvoyés : sont-ils pertinents et complets ? Si ce n'est pas le cas, essayez d'ajuster la taille des fragments ou d'ajouter un document manquant, puis testez à nouveau.

Suivre ce cours dans OUPI → Cet exercice se fait dans la plateforme OUPI.
À retenir

Les documents en échec sont généralement dus à un problème de format ou de taille — retéléversez une version plus propre ou demandez à votre administrateur de les retraiter. L'indexation consomme des crédits d'embedding proportionnels à la taille du contenu, et les limites de documents sont fixées par votre offre et votre administrateur. Pour une récupération optimale : conservez une base par sujet, ajustez la taille des fragments uniquement si nécessaire, et testez toujours avec de vraies questions via le champ de recherche intégré. Ces bonnes pratiques garantissent que les réponses de l'IA restent fiables, précises et pertinentes.