Combien de mémoire vraiment pour ton agent IA ?

Pourquoi ça compte pour toi
Si tu construis un agent IA, tu crois instinctivement que plus de contexte = mieux. Faux. Cette recherche montre que les petits modèles se noient dans trop de directives, tandis que les puissants en réclament davantage. Et le bonus : la sélection intelligente coûte 50% de tokens en moins pour une meilleure précision.
Ce qu'il faut retenir
- 1.Les modèles forts veulent la totalité des directives ; les faibles préfèrent un noyau compact + récupération par tâche
- 2.La récupération ciblée peut être à la fois plus précise et moins chère qu'injecter toute la mémoire
- 3.Les modèles saturés (déjà au plafond) ne bénéficient d'aucune mémoire supplémentaire
Tu galères avec le jargon ?
Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.
Le paradoxe de la mémoire d'agent
Imagine un agent IA qu'on nourrit avec toutes ses leçons passées. Logiquement, il devrait s'améliorer. Sauf que ça ne marche pas systématiquement — et c'est là que l'enseignement change tout.
Cette étude teste huit modèles différents (du dense 30B aux systèmes propriétaires de pointe) avec ALTK-Evolve, un système qui extrait des directives comportementales des trajectoires passées de l'agent, sans toucher aux poids du modèle.
Trois profils émergent
Les modèles forts avec de la marge (DeepSeek-V3.2 671B, Claude Opus 4.6) : ils veulent tout. La totalité des directives, y compris les cas limites rares. DeepSeek gagne +9,5 points de complétude de tâche. C'est grâce à leur capacité brute à absorber et appliquer l'ensemble.
Les modèles moyens (gpt-oss-120b, 117B) : ils se noient. Donner toutes les directives les perd. Mais un noyau compact et haut-confiance, plus quelques directives ciblées par tâche ? Là, gpt-oss-120b gagne +16,1 points — plus qu'avec l'ensemble complet. Et avec 51% de tokens en moins au lieu de 78%.
Les modèles saturés (GLM-5, 745B) : aucun gain mesurable. Soit ils sont déjà au plafond sur ces tâches, soit les directives ne ciblent pas leurs vrais blocages.
Ce qui détermine le profil n'est pas juste la taille. La marge de progression sur les benchmarks, la taille du contexte, l'architecture, la qualité des directives — tout joue.
L'astuce : pas de mise à jour des poids
La mémoire ici n'est pas une relecture de transcriptions. C'est un ensemble de stratégies : ce qui a marché, les pièges à éviter, les cas singuliers. L'agent produit des trajectoires, ALTK-Evolve distille des directives, les consolide, puis les injecte à l'inférence. Zéro modification des poids du modèle.
Pourquoi ça compte ? C'est portable. Testé sur huit modèles différents. Et peu coûteux à adopter.
Le résultat qui tue : meilleur + moins cher
Sur AppWorld (585 tâches multi-étapes sur 9 applis simulées), la récupération ciblée pour gpt-oss-120b : +16,1 points de complétude, +5% de tokens seulement. Comparé au guideline complet qui demande +51%.
Et en production ? La mise en cache du prompt rend même le guideline complet abordable — la portion statique se met en cache, l'économie s'accumule.
Le vrai message pour toi : stop à la mentalité « plus c'est mieux ». Teste ton modèle, calibre sa dose.
Et concrètement pour toi ?
Choisis ton profil — la lecture de l'article change selon qui tu es.
Pour toi, retiens que « plus » n'a jamais été la réponse en technologie. Les meilleurs systèmes fonctionnent souvent avec des contraintes intelligentes, pas des ressources infinies. La vraie innovation aujourd'hui, c'est faire mieux avec moins, pas l'inverse.
Essayer maintenant
Lire la recherche complète sur Hugging Face →Source
Pour aller plus loin
Cet article t'a donné envie d'approfondir ? Deux formations Noésis t'attendent :
Explorer les thèmes de cet article :