Intermédiaire·2 min·20 août 2026

LFM2.5-DSpark : jusqu'à 3,2x plus rapide sur ton GPU

🎧 Résumé audio0:00 / 0:00
Liquid AI sort des modèles de brouillon qui accélèrent l'inférence de 3x sans changer la qualité.
LFM2.5-DSpark : jusqu'à 3,2x plus rapide sur ton GPU

Pourquoi ça compte pour toi

Si tu fais tourner des LLM localement ou sur GPU, c'est du concret : moins d'attente, moins de consommation. La technique (décodage spéculatif) prouve que la vitesse brute n'est pas le seul axe d'amélioration — parfois, c'est juste une question d'organisation intelligente du calcul. Et ça marche du MacBook au H100.

Ce qu'il faut retenir

  • 1.Décodage spéculatif : un petit modèle de brouillon suggère des tokens, le gros les vérifie en parallèle
  • 2.Gains mesurés : 3,18x sur H100, 2,27x en moyenne sur MacBook M4 Max
  • 3.Prise en charge dès le premier jour sur llama.cpp et SGLang : tu peux tester maintenant
  • 4.Latence des appels de fonction réduite de 57% en moyenne — critique pour les agents

Tu galères avec le jargon ?

Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.

Pourquoi c'est plus rapide (sans trucage)

En inférence, le goulot est rarement le calcul brut. C'est surtout le chargement des poids depuis la RAM vers le cache — et ça prend du temps.

Le décodage spéculatif dit : au lieu de faire 1 étape de décodage lent, on fait 10 propositions rapides (via un petit modèle), puis on les vérifie toutes d'un coup avec le gros modèle. La charge des poids se dilue sur 10 tokens d'un coup. Résultat : on économise des allers-retours à la RAM.

Comment Liquid AI l'a mis en place

Trois composants :

  1. Backbone parallèle (DFlash-style) : le petit modèle génère les candidats en une seule passe
  2. Tête séquentielle (chaîne de Markov) : ajoute des dépendances entre tokens voisins pour améliorer le taux d'acceptation
  3. Vérificateur de confiance : évalue la probabilité de survie de chaque token et coupe les queues douteuses (si vérifier coûte plus cher que le gain)

Les modèles de brouillon ? ~300M paramètres, 5 couches d'attention — légers.

Les chiffres en vrai

Sur H100 (GPU sérieux) :

  • LFM2.5-2.6B : 2,67x d'accélération en moyenne (323 → 864 tok/s)
  • LFM2.5-8B-A1B : 2,54x (418 → 1074 tok/s)

Sur MacBook M4 Max (appareil embarqué) :

  • LFM2.5-2.6B : 2,27x en moyenne (61 → 139 tok/s)
  • LFM2.5-1.2B-Instruct : 2,54x (138 → 350 tok/s)

Nota : Le 8B sur Mac ne gagne que 18% — le problème vient de l'implémentation MoE dans Metal, pas de la technique elle-même.

Cas d'usage réel : appels de fonction

Pour les agents qui doivent analyser des JSON ou appeler des fonctions : 57% de latence en moins. C'est considérable quand tu enchaînes 50 appels par seconde.

Comment tester

Via SGLang (GPU) :

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-2.6B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-2.6B-DSpark

Via llama.cpp (local) :

llama-server -m LFM2.5-2.6B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 10

L'honnêteté de la technique

Le décodage spéculatif ne triche pas : si un candidat proposé est rejeté, le vrai token du modèle cible le remplace. La sortie greedy est identique à l'original. Aucun compromis sur la qualité.

C'est juste : comment faire la même chose plus vite ? La réponse : paralléliser la vérification au lieu de décoder 1 token à la fois.

Et concrètement pour toi ?

Choisis ton profil — la lecture de l'article change selon qui tu es.

🔭 Curieux

Pour toi, cette news montre que l'IA ne progresse pas juste en taille : ici, un petit modèle de brouillon smart peut donner 3x plus de vitesse au grand. C'est un pattern qu'on va voir partout — l'efficacité devient aussi importante que la puissance brute.

📊 Cours en bourse

Newsletters Noésis

3 minutes d'IA dans ta boîte mail, chaque matin.

Rejoins les francophones qui comprennent, essaient et progressent avec l'IA. Choisis ce que tu veux recevoir. Désabonnement en 1 clic.

Explorer les thèmes de cet article :