LFM2.5-DSpark : jusqu'à 3,2x plus rapide sur ton GPU

Pourquoi ça compte pour toi
Si tu fais tourner des LLM localement ou sur GPU, c'est du concret : moins d'attente, moins de consommation. La technique (décodage spéculatif) prouve que la vitesse brute n'est pas le seul axe d'amélioration — parfois, c'est juste une question d'organisation intelligente du calcul. Et ça marche du MacBook au H100.
Ce qu'il faut retenir
- 1.Décodage spéculatif : un petit modèle de brouillon suggère des tokens, le gros les vérifie en parallèle
- 2.Gains mesurés : 3,18x sur H100, 2,27x en moyenne sur MacBook M4 Max
- 3.Prise en charge dès le premier jour sur llama.cpp et SGLang : tu peux tester maintenant
- 4.Latence des appels de fonction réduite de 57% en moyenne — critique pour les agents
Tu galères avec le jargon ?
Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.
Pourquoi c'est plus rapide (sans trucage)
En inférence, le goulot est rarement le calcul brut. C'est surtout le chargement des poids depuis la RAM vers le cache — et ça prend du temps.
Le décodage spéculatif dit : au lieu de faire 1 étape de décodage lent, on fait 10 propositions rapides (via un petit modèle), puis on les vérifie toutes d'un coup avec le gros modèle. La charge des poids se dilue sur 10 tokens d'un coup. Résultat : on économise des allers-retours à la RAM.
Comment Liquid AI l'a mis en place
Trois composants :
- ▸Backbone parallèle (DFlash-style) : le petit modèle génère les candidats en une seule passe
- ▸Tête séquentielle (chaîne de Markov) : ajoute des dépendances entre tokens voisins pour améliorer le taux d'acceptation
- ▸Vérificateur de confiance : évalue la probabilité de survie de chaque token et coupe les queues douteuses (si vérifier coûte plus cher que le gain)
Les modèles de brouillon ? ~300M paramètres, 5 couches d'attention — légers.
Les chiffres en vrai
Sur H100 (GPU sérieux) :
- ▸LFM2.5-2.6B : 2,67x d'accélération en moyenne (323 → 864 tok/s)
- ▸LFM2.5-8B-A1B : 2,54x (418 → 1074 tok/s)
Sur MacBook M4 Max (appareil embarqué) :
- ▸LFM2.5-2.6B : 2,27x en moyenne (61 → 139 tok/s)
- ▸LFM2.5-1.2B-Instruct : 2,54x (138 → 350 tok/s)
Nota : Le 8B sur Mac ne gagne que 18% — le problème vient de l'implémentation MoE dans Metal, pas de la technique elle-même.
Cas d'usage réel : appels de fonction
Pour les agents qui doivent analyser des JSON ou appeler des fonctions : 57% de latence en moins. C'est considérable quand tu enchaînes 50 appels par seconde.
Comment tester
Via SGLang (GPU) :
python -m sglang.launch_server \
--model-path LiquidAI/LFM2.5-2.6B \
--speculative-algorithm DSPARK \
--speculative-draft-model-path LiquidAI/LFM2.5-2.6B-DSpark
Via llama.cpp (local) :
llama-server -m LFM2.5-2.6B-F16.gguf \
-md LFM2.5-2.6B-DSpark-F16.gguf \
--spec-type draft-dspark --spec-draft-n-max 10
L'honnêteté de la technique
Le décodage spéculatif ne triche pas : si un candidat proposé est rejeté, le vrai token du modèle cible le remplace. La sortie greedy est identique à l'original. Aucun compromis sur la qualité.
C'est juste : comment faire la même chose plus vite ? La réponse : paralléliser la vérification au lieu de décoder 1 token à la fois.
Et concrètement pour toi ?
Choisis ton profil — la lecture de l'article change selon qui tu es.
Pour toi, cette news montre que l'IA ne progresse pas juste en taille : ici, un petit modèle de brouillon smart peut donner 3x plus de vitesse au grand. C'est un pattern qu'on va voir partout — l'efficacité devient aussi importante que la puissance brute.
Essayer maintenant
Tester les modèles sur Hugging Face →Source
📊 Cours en bourse
Pour aller plus loin
Cet article t'a donné envie d'approfondir ? Deux formations Noésis t'attendent :
Explorer les thèmes de cet article :