Granite 4.2 : comment IBM construit ses IA qui pensent

Pourquoi ça compte pour toi
Si tu construis un agent ou une application qui doit résoudre des problèmes complexes, tu dois comprendre comment fonctionnent les derniers modèles de raisonnement. Granite 4.2 montre comment passer d'une IA qui suit des ordres à une IA qui pense étape par étape — et c'est open-source Apache 2.0, donc tu peux l'utiliser sans traîner une chaîne de licences.
Ce qu'il faut retenir
- 1.Trois tailles (3B, 8B, 30B), même architecture : transformer dense avec GQA, contexte jusqu'à 512K tokens
- 2.Entraînement sur 15 trillions de tokens en 5 phases, puis affinage supervisé sur 100B tokens de données de raisonnement et d'agentique
- 3.Les modèles 8B et 30B apprennent à utiliser des outils dans des environnements réels (terminal, code, recherche web)
- 4.Mode 'thinking' vs 'non-thinking' : dépense du budget de réflexion selon la difficulté de la question
- 5.Tous prennent en charge l'appel natif de fonctions compatible OpenAI et SGLang
Tu galères avec le jargon ?
Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.
Comment on construit une IA qui pense
Granite 4.2 n'est pas juste un gros modèle. C'est une IA qu'on a entraînée à penser avant de répondre — et ça change tout.
L'architecture : simple et efficace
Les trois modèles partagent le même design : transformer decoder-only, attention groupée (GQA), embedding rotatoire (RoPE), activation SwiGLU. Rien d'extravagant, juste des briques éprouvées assemblées proprement.
À noter : le contexte s'étend jusqu'à 512K tokens. Si tu fournis un document de 200 pages, l'IA le garde en tête.
L'entraînement : 5 phases stratégiques
15 trillions de tokens, c'est énorme. Mais l'équipe IBM ne les balance pas tous en même temps :
- ▸Phases 1-2 : fondations larges, données web variées
- ▸Phases 3-4 : données sélectionnées de meilleure qualité, plus resserrées
- ▸Phase 5 : contexte long (512K), c'est ici qu'on apprend à gérer les énormes documents
Chaque phase a son propre mélange de données et son calendrier d'apprentissage. Progressivement, on passe du web brut aux sources polies.
Le raisonnement en boîte : affinage supervisé sur 100B tokens
Après le pré-entraînement, on affine le modèle avec des données de raisonnement. 7,2 millions d'exemples, dont :
- ▸68% non-agentique : suivi d'instructions, codage, maths, multilinguisme, sciences
- ▸32% agentique : trajectoires d'agents (69% génie logiciel, 12% appel d'outils, 8% terminal)
Le contrôle qualité ? Triple filtrage :
- ▸Normalise tout en format OpenAI Chat standard
- ▸Des juges IA (GPT-OSS-120B, Gemma 4) notent chaque exemple — les mauvaises réponses et hallucinations sont écartées
- ▸Déduplication par hash SHA-256
Résultat : 100B tokens de vraie qualité pour apprendre à raisonner.
Le superpouvoir : RL en multi-étapes
Après l'affinage supervisé, arrive la partie sophistiquée : reinforcement learning en chaîne.
Au lieu de bombarder le modèle avec une seule étape RL générique, IBM crée des phases successives, chacune ciblant une compétence :
- ▸Maths → Code → Science → Suivi d'instructions → Appel d'outils → Sortie structurée → Génie logiciel → Terminal → Recherche web
Chaque étape est un RL indépendant. L'idée : l'IA apprend à devenir meilleure progressivement, en maîtrisant d'abord les bases avant les trucs difficiles.
Pour les modèles 8B et 30B, ajoute l'RL agentique : l'IA apprend à agir dans des environnements sandboxés réels. Elle lance du code, contrôle un terminal, cherche sur le web — pas en simulation, en vrai.
L'interrupteur on/off : pense ou réponds
Chaque modèle a un mode 'thinking' et 'non-thinking'.
- ▸Thinking : l'IA passe du temps à réfléchir avant de donner sa réponse (chaîne de pensée explicite)
- ▸Non-thinking : réponds tout de suite
- ▸Low-effort : à mi-chemin, dépense juste un peu de budget de réflexion sur les questions faciles
Tu contrôles. Si la question est triviale, pas besoin de creuser.
L'intégration : compatible OpenAI
Tous les modèles prennent en charge l'appel natif de fonctions au format OpenAI. Pas de code de raccordement, ça marche directement avec vLLM ou SGLang. Les outils s'intègrent comme si c'était GPT.
Pourquoi c'est important pour toi
Granite 4.2 montre que le raisonnement explicite n'est pas une magie propriétaire. C'est un processus : pré-entraînement stratégique → affinage supervisé contrôlé → RL progressif.
Si tu construis un agent ou un système complexe, tu peux partir sur ces briques ouvertes, les ajuster pour ton cas d'usage, et ne pas dépendre de l'API d'un éditeur.
Et les trois tailles ? 3B pour des appareils limités, 8B pour la production allégée, 30B pour la puissance brute. À toi de choisir le compromis qui te convient.
Et concrètement pour toi ?
Choisis ton profil — la lecture de l'article change selon qui tu es.
Pour toi, comprendre le mode 'thinking' c'est comprendre la vraie différence entre répondre vite et réfléchir profond : c'est pas juste du marketing, c'est une architecture qui laisse le modèle dire 'attends, je dois vraiment y réfléchir' avant de répondre. Ça montre où va l'IA de demain.
Essayer maintenant
Accéder aux modèles Granite 4.2 →Source
📊 Cours en bourse
Pour aller plus loin
Cet article t'a donné envie d'approfondir ? Deux formations Noésis t'attendent :
Explorer les thèmes de cet article :