Rares sont les modèles d’intelligence artificielle capables d’offrir une vraie puissance de raisonnement sans imposer une latence frustrante. Le laboratoire chinois Stepfun bouscule ce compromis avec le lancement de Step 3.7 Flash. Le modèle se place sur la frontière de Pareto, là où intelligence et vitesse de génération trouvent un équilibre rare.
À retenir
- Un score de 43 sur l’indice d’intelligence d’Artificial Analysis, inégalé pour un modèle aussi rapide.
- Une vitesse de sortie supérieure à 400 tokens par seconde, soit plusieurs centaines de mots par seconde.
- Une architecture Mixture-of-Experts de 198 milliards de paramètres, dont seulement 11 milliards activés par requête.
- Un premier token généré en 0,97 seconde (TTFT), essentiel pour les usages conversationnels.
- Un modèle pensé pour les agents autonomes, avec une capacité native à analyser texte et image.
Le lancement de Step 3.7 Flash concerne directement les développeurs d’agents et les entreprises qui veulent héberger une IA puissante sur leurs propres serveurs. Les grands modèles d’OpenAI ou de Google brillent souvent par leurs capacités, mais ils restent gourmands en calcul et donc en coûts. Ce nouveau venu prétend casser ce lien historique entre intelligence et lourdeur matérielle, en affichant des performances de pointe à un tarif d’entrée de gamme.
Le secret de la fluidité : un modèle massif, mais sobre en calcul
Le cœur technique de Step 3.7 Flash repose sur une architecture MoE (Mixture-of-Experts) de 198 milliards de paramètres. Le terme peut impressionner, mais la logique derrière est simple et efficace.

Onze milliards de paramètres actifs, pas un de plus
Sur ces 198 milliards de paramètres, seuls 11 milliards sont activés pour générer chaque mot. Imaginez une immense usine de 1 500 employés où, pour chaque commande, seuls les 60 experts les plus pertinents se mettent au travail. Les autres restent en veille. Cette approche, dite « sparse », permet au modèle d’avoir une culture générale immense sans faire chauffer inutilement les processeurs.
Le résultat est mesurable : un temps de réponse initial inférieur à une seconde et un débit continu qui dépasse 400 tokens par seconde sur l’infrastructure adaptée. Concrètement, le modèle peut générer l’équivalent d’un rapport de 700 mots en moins de deux secondes.
Une fenêtre pour analyser des romans entiers
La capacité d’analyse est un autre pilier de cette architecture. Avec une fenêtre de contexte de 256 000 tokens, Step 3.7 Flash peut ingérer et comprendre en une seule fois de très longs documents. Cela représente environ 150 000 mots, soit la longueur d’un bon roman de poche. Pour des agents chargés d’analyser des contrats juridiques ou des bases de code volumineuses, cette caractéristique évite de découper le travail et renforce la cohérence de l’analyse.
La latence n’est plus un bon indicateur de la puissance d’un modèle. C’est surtout un paramètre qu’on ajuste.
Une analyse partagée par les ingénieurs ayant testé le modèle sur OpenRouter.
Un module de raisonnement ajustable pour tous les profils de tâches
Ce qui distingue réellement Step 3.7 Flash de la concurrence, c’est l’introduction d’un effort de raisonnement modulable. Une innovation qui vise clairement le monde de l’automatisation et des agents.
Trois vitesses de pensée pour un seul modèle
Les développeurs peuvent choisir entre trois niveaux, bas, moyen et haut, pour chaque requête envoyée à l’API. Pour une tâche simple d’extraction de données, le niveau bas offre une rapidité maximale et un coût minimal. Pour du débogage complexe ou une planification stratégique, le niveau haut donne au modèle davantage de temps de réflexion interne.
Cette flexibilité lui permet d’exceller sur SWE-bench Pro, un test de programmation avancé, avec un score de 56,3 %, devant le très récent DeepSeek V4 Flash. Sur les tâches spécifiques aux agents, comme ClawEval-1.1, il décroche un score de 67,1, ce qui en fait une référence actuelle pour sa catégorie de taille.

Un allié fiable pour l’orchestration d’outils
La conception de ce modèle prend tout son sens avec les applications d’agents autonomes. Step 3.7 Flash fait preuve d’une fiabilité rare dans le tool calling, c’est-à-dire l’art d’appeler et d’orchestrer des outils externes (bases de données, agendas, API). Sa vision native lui permet même de naviguer dans une interface graphique, de repérer un bouton ou de signaler qu’une donnée visuelle manque pour accomplir sa mission. Il ne se contente pas d’inventer une réponse plausible, il demande une clarification.
Le matériel local entre dans la danse
Un point crucial pour la souveraineté des données est sa capacité à tourner sur du matériel grand public haut de gamme. Un serveur équipé de 128 Go de mémoire unifiée, comme un Mac Studio ou une station de travail, peut l’héberger. C’est un vrai atout pour une entreprise qui veut garder ses données clients hors des grands clouds américains. La licence Apache 2.0, qui autorise l’usage commercial sans contrepartie, lève le dernier frein à son adoption.
Un prix cassé : 0,20 dollar le million de tokens
Le modèle économique affiché par Stepfun est très agressif. Avec un prix de 0,20 dollar (soit environ 0,17 euro) par million de tokens en entrée via OpenRouter, Step 3.7 Flash figure parmi les offres les plus compétitives du marché.
Ramené à l’usage, générer un texte de 700 mots coûte une fraction de centime d’euro. Pour une start-up ou une PME qui automatise des milliers de tâches par mois, l’économie est nette face aux modèles 100 % cloud aux performances équivalentes. On obtient ici un trio rare : vitesse d’exécution, puissance de raisonnement et prix contenu.
Pour autant, il serait naïf de croire que l’hébergement local efface toute contrainte. Le déploiement sur un NVIDIA DGX Spark ou une machine similaire représente un investissement initial de plusieurs milliers d’euros. Le coût du matériel reste le ticket d’entrée pour qui souhaite s’extraire des abonnements aux API. La promesse de Stepfun n’est pas la gratuité totale, mais une vraie marge de manœuvre pour les développeurs d’agents.
















Laisser un commentaire
Vous devez vous connecter pour publier un commentaire.