Intermédiaire·3 min·21 août 2026

DeepSeek intègre la vision : analyse d'images en API

🎧 Résumé audio0:00 / 0:00
DeepSeek lance son modèle de vision en API. Tu peux maintenant envoyer des images directement à son IA.
DeepSeek intègre la vision : analyse d'images en API

Pourquoi ça compte pour toi

Jusqu'à présent, DeepSeek était texte pur. Là, tu accèdes à une vision multimodale compatible OpenAI — utile si tu construis des outils qui analysent captures d'écran, graphiques, documents scannés. Et c'est moins cher que Claude ou GPT-4V pour la plupart des cas.

Ce qu'il faut retenir

  • 1.Modèle : deepseek-v4-flash-vision-exp. Accepte JPEG, PNG, GIF, WebP en 3 formats : base64 intégré, URL externe, ou Files API.
  • 2.Trois méthodes d'envoi : intégration directe (simple, local), lien HTTP (rapide), ou upload persistant (gros fichiers, réutilisation).
  • 3.Jusqu'à 600 images par requête, 200 MiB max avec Files API. Les images se convertissent en tokens (max ~384 par image après redimensionnement).
  • 4.API compatible OpenAI ET Anthropic — tu peux basculer ton endpoint sans réécrire ton code.

Tu galères avec le jargon ?

Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.

Pourquoi tu devrais tester

DeepSeek vision te permet d'accélérer des workflows répétitifs : scanner des factures, extraire du texte de captures d'écran, analyser des tableaux. C'est surtout pertinent si tu as du volume (beaucoup d'images) et que tu veux réduire ta facture IA.

Les trois façons d'envoyer une image

1. Base64 intégré : tu encodes l'image en base64 et tu l'intègres directement dans ta requête. Idéal pour des fichiers locaux, mais attention : ça compte dans la limite des 48 Mo de corps de requête. Les données encodées gonflent de ~33%.

import base64
from openai import OpenAI

client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")

with open("image.jpg", "rb") as f:
    b64 = base64.b64encode(f.read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "What is in this image?"},
            {"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}}
        ]
    }]
)
print(response.choices[0].message.content)

2. URL externe : tu passes un lien HTTPS public, DeepSeek télécharge l'image. Max 8192 caractères d'URL, max 32 Mo par image, 60 secondes pour télécharger. Plus rapide pour le web, aucun envoi de ta part.

3. Files API : tu envoies une image une fois, tu récupères un file_id, tu le réutilises autant que tu veux. Parfait si tu analyses la même image plusieurs fois ou si elle fait >32 Mo (jusqu'à 64 Mo via Files API). Zéro envoi répété.

Ajuster la précision avec detail

Pour les URLs externes, tu peux réduire la résolution ("low" = 512×512, plus rapide et moins cher) ou garder l'original ("high" ou "original"). Le mode "auto" choisit pour toi.

{"type": "image_url", "image_url": {"url": "https://example.com/image.jpg", "detail": "low"}}

Les limites à connaître

  • Jusqu'à 600 images par requête (mais attention : avec 15+ images, chaque dimension max tombe à 4096px au lieu de 8192px).
  • 200 MiB de poids total si tu utilises Files API, sinon 64 MiB.
  • Chaque image consomme jusqu'à ~384 tokens — peu importe si elle fait 2000×2000 ou 5000×5000, elle se redimensionne à l'équivalent d'une 800×800, donc coût identique.
  • Images seulement dans les messages "user" ou "developer", pas en "system" ou "assistant" (retour 400).

OpenAI ou Anthropic ?

Tu peux utiliser l'endpoint compatible OpenAI (par défaut) ou passer par l'endpoint compatible Anthropic (base_url: https://api.deepseek.com/anthropic). La structure des blocs d'image diffère légèrement ("image_url" vs "image" avec "source"), mais c'est juste de la surface — tu choisis selon ton code existant.

À retenir

C'est de la vision sans fioritures : pas de fine-tuning, pas de modèles custom. Mais pour un scraper intelligent, un extracteur de données, un assistant d'analyse de documents, c'est efficace et bon marché. Et comme c'est compatible OpenAI/Anthropic, tu peux tester sans réécrire de code.

Et concrètement pour toi ?

Choisis ton profil — la lecture de l'article change selon qui tu es.

🔭 Curieux

Pour toi, la vraie news c'est que DeepSeek casse les prix : Claude Vision à 100€ pour 1M d'images devient 30-40€. Ça signifie que vision multimodale sort de la niche premium — demande-toi quels outils du quotidien vont intégrer ça dans 6 mois.

Newsletters Noésis

3 minutes d'IA dans ta boîte mail, chaque matin.

Rejoins les francophones qui comprennent, essaient et progressent avec l'IA. Choisis ce que tu veux recevoir. Désabonnement en 1 clic.

Explorer les thèmes de cet article :