Un appel de modèle isolé se mesure avec une latence et un statut. Un agent enchaîne des raisonnements, des recherches et des outils qui modifient parfois le monde extérieur. Pour comprendre un échec, il faut reconstruire cette trajectoire sans enregistrer de données sensibles.
Les trois niveaux d'une trace agentique
La trace racine représente la tâche utilisateur. Chaque tour de modèle devient un span, et chaque appel d'outil un span enfant. Les appels HTTP, base de données ou file de messages conservent leurs propres conventions.
Un identifiant de corrélation relie la demande, la session, la PR et le déploiement. Cette structure permet de répondre à une question simple : quelle décision a conduit à cette action ?
Les attributs utiles
Enregistrez le fournisseur, le modèle, le type d'opération, le statut, la latence, les tokens d'entrée et de sortie, le cache, l'outil appelé et le nombre de tentatives. Ajoutez des dimensions métier à faible cardinalité : environnement, équipe, type de tâche et niveau de risque.
OpenTelemetry maintient des conventions sémantiques pour l'IA générative, notamment autour des modèles, usages et outils. Attention : les arguments et résultats d'outils peuvent contenir des informations sensibles. Ils ne doivent pas être collectés sans filtrage.
Les métriques à suivre
- taux de tâches terminées et abandonnées ;
- latence totale et par outil ;
- nombre de tours et d'appels d'outils ;
- consommation de tokens et coût estimé ;
- taux d'erreur, de retry et de timeout ;
- interventions humaines ;
- échecs de permission et actions bloquées ;
- régressions détectées après livraison.
Évitez les identifiants utilisateur ou les prompts complets comme labels de métriques : ils créent une forte cardinalité et un risque de fuite.
Journaliser le raisonnement ?
La bonne cible n'est pas une transcription interne exhaustive. Conservez plutôt les décisions observables : outil sélectionné, paramètres filtrés, résultat, validation et justification synthétique. Cette approche produit une piste d'audit exploitable sans transformer la télémétrie en copie du contexte privé.
Construire des alertes pertinentes
Une alerte utile signale une dérive : explosion du nombre de tours, hausse des refus d'autorisation, coût par tâche anormal, boucle d'outil, chute du taux de réussite ou augmentation des corrections humaines.
Définissez un budget par tâche et un coupe-circuit. Un agent qui dépasse le temps, le coût ou le nombre d'actions autorisé doit s'arrêter proprement et fournir son état.
Relier observabilité et évaluation
Les traces de production révèlent des scénarios à ajouter au benchmark. À l'inverse, les critères du benchmark d'agents IA indiquent quels événements instrumenter.
Pour les agents de code, rattachez les traces au commit et aux résultats de tests. Vous pourrez comparer coût, délai, qualité du diff et nombre de retours de revue.
Checklist de mise en production
- Propagation d'un identifiant de trace de bout en bout.
- Masquage des secrets avant export.
- Rétention courte pour les contenus sensibles.
- Métriques sans données personnelles.
- Alertes de boucle, coût et permission.
- Accès aux traces limité et audité.
- Version du modèle et des instructions enregistrée.
quelle étape de votre workflow accepteriez-vous de déléguer à un agent, et laquelle garderiez-vous obligatoirement sous contrôle humain ?
Publié dans la discussion