Calculateur de débit d'agents IA
Dimensionnez un pipeline d'agents événementiel avant de le construire : concurrence nécessaire, point de saturation, latence p95 ressentie et coût mensuel en tokens.
Votre charge
Débit de pointe soutenu sur le flux source, pas la moyenne quotidienne.
Filtres et règles absorbent en général la plupart des événements avant tout appel modèle.
Temps aller-retour d'un appel de décision, outils déclenchés inclus.
Nombre de décisions exécutées en parallèle — souvent limité par les quotas du fournisseur.
Prompt plus complétion, en moyenne sur l'étape.
Mettez 0 pour un modèle local tournant sur du matériel que vous possédez déjà.
Ce que ça demande
4,320,000 événements par jour arrivent dans le pipeline.
Saturée — le retard grandit d'environ 133 événements par minute.
Temps modèle plus attente en file — ce que subit réellement l'action en aval.
Emplacements requis pour tenir ~75 % d'utilisation avec de la marge pour les pics.
Étape de décision seulement. Filtrer plus tôt en amont est le levier le moins cher.
Décisions par seconde soutenables au maximum, à concurrence et latence actuelles.
Cette configuration ne suit pas. Augmentez la concurrence, filtrez plus d'événements avant le modèle, ou utilisez un modèle plus rapide pour la première passe.
Ces chiffres sont une approximation de file d'attente pour la planification de capacité, pas un benchmark. Validez sur un flux de production rejoué avant de vous engager.
Questions
Comment dimensionner la concurrence d'un pipeline d'agents IA ?
Multipliez les décisions par seconde par la latence du modèle en secondes, puis ajoutez environ 30 % de marge. Une étape à 20 décisions/s avec 900 ms de latence demande environ 24 emplacements concurrents pour rester sous la saturation.
Que se passe-t-il quand une étape d'agent est saturée ?
Une utilisation supérieure à 100 % signifie que la file croît sans limite : la latence monte chaque minute et, sans journal d'événements durable, des événements finissent par être perdus. La backpressure sur un flux rejouable transforme cette panne en simple retard récupérable.
Pourquoi l'attente en file est-elle pire que la latence du modèle ?
La latence du modèle est fixe par appel, mais l'attente en file croît de façon non linéaire quand l'utilisation approche 100 %. À 90 % d'utilisation, l'attente vaut déjà environ neuf fois le temps de service par emplacement — d'où l'importance de dimensionner sur le pic, pas la moyenne.
Ces chiffres sont-ils exacts ?
Non. Il s'agit d'une approximation de file d'attente pour la planification de capacité, pas d'un benchmark. Elle suppose un taux d'arrivée stable et une seule étape de décision. Utilisez-la pour l'ordre de grandeur et le point de saturation, puis validez sur un flux de production rejoué.
Méthode
L'étape de décision est modélisée comme une file M/M/c : arrivées aléatoires, temps de service variable, c emplacements concurrents. L'utilisation vaut le taux d'arrivée divisé par c/temps de service ; l'attente croît de façon non linéaire quand elle approche 100 %.
Libre d'utilisation et de citation. À lire aussi : comment construire un agent événementiel. Réalisé par l'équipe derrière Pulse, un runtime d'agents open source.