OpenAI et Broadcom dévoilent Jalapeño, une puce qui surpasse les GPU NVIDIA en efficacité et en vitesse

·

·

Gros plan d’un module de puce d’inférence OpenAI Jalapeño dans une baie de serveurs modernes, avec du matériel NVIDIA flou en arrière-plan dans un datacenter.
Résumer cet article avec :

OpenAI a dévoilé les premiers benchmarks de sa puce d’inférence Jalapeño, co-conçue avec Broadcom. Les résultats, mesurés par SemiAnalysis, montrent une efficacité énergétique et une latence nettement supérieures aux systèmes NVIDIA GB200 et GB300. De quoi rebattre les cartes dans le silicium dédié à l’IA.


À retenir

  • Jalapeño offre 1,5× à 1,9× de débit par kilowatt de plus que les systèmes NVIDIA GB200 et GB300.
  • La latence de bout en bout est réduite de 1,7× à 3,6× de latence, selon le benchmark public InferenceX.
  • La puce consomme au maximum 550 W mesurés en charge, contre 1 200 W et 1 400 W pour les architectures Blackwell.
  • Environ 1 400 tokens par seconde et par utilisateur sur GPT-OSS 120B, sans astuce logicielle.
  • Premiers déploiements prévus fin 2026, avec 10 GW déployés d’ici 2029.

L’annonce touche directement à l’avenir de l’IA générative. L’inférence représente plus de la moitié des dépenses d’exploitation d’OpenAI : une puce conçue pour cette tâche pourrait réduire le coût des API, accélérer les agents logiciels et limiter la dépendance à NVIDIA.

Jalapeño face aux systèmes NVIDIA

Présentés le 25 août 2026 sur scène à la conférence Hot Chips, les chiffres de Jalapeño dessinent un écart net. Sur le benchmark public InferenceX de SemiAnalysis, la puce d’OpenAI devance les systèmes NVIDIA GB200 et GB300 sur deux critères centraux pour l’inférence : la vitesse de réponse et le rendement énergétique.

Le compromis débit-latence tombe

Les GPU classiques obligent souvent à arbitrer entre un débit élevé et une faible latence. Selon les mesures de SemiAnalysis, Jalapeño évite en partie ce compromis : son débit par kilowatt est 1,5× à 1,9× supérieur à celui des systèmes GB200 et GB300. Sur la latence de bout en bout, le gain atteint 1,7× à 3,6×. Pour les charges interactives les plus exigeantes, l’avantage grimpe même jusqu’à 4,1× par kilowatt.

Rangée de baies de serveurs avec des modules d’inférence OpenAI Jalapeño au premier plan et des systèmes NVIDIA GB200 et GB300 à côté, surveillés par des techniciens dans un datacenter.
Sur InferenceX, Jalapeño affiche de meilleurs résultats que les systèmes NVIDIA en débit et en latence.

Des tokens à la volée sur des modèles variés

Les tests ne se limitent pas à un modèle maison. Jalapeño a fait tourner GPT-OSS 120B à près de 1 400 tokens par seconde et par utilisateur. Sur DeepSeek R1, un modèle de 670 milliards de paramètres, la cadence reste au-dessus de 700 tokens par seconde. Même Kimi K2.5 de Moonshot AI, avec son trillion de paramètres, est pris en charge. Ces résultats sont obtenus sans décodage spéculatif, qui peut masquer une partie de la latence réelle.

Sobriété et coût : l’argument climat et économique

La puce affiche un TDP de 700 W, mais consomme en réalité 550 W au maximum en charge soutenue. Ce chiffre reste loin des 1 200 W de la GB200 et des 1 400 W de la GB300. Pour les datacenters dont la facture dépend de la puissance appelée, cet écart réduit directement le coût par requête et l’empreinte carbone.

Nous avons conçu Jalapeño pour l’inférence, pas pour la démonstration. Chaque watt est converti en tokens utiles.
— Richard Ho, vice-président matériel chez OpenAI, lors de Hot Chips.

Des chiffres publiés par OpenAI, à prendre avec prudence

Ces résultats ont été publiés par une entreprise qui a tout intérêt à les mettre en avant. Les mesures ont néanmoins été réalisées par SemiAnalysis avec sa suite InferenceX, devenue une référence publique dans l’industrie. Les trois modèles testés, dont deux ne viennent pas d’OpenAI, réduisent le risque d’un scénario taillé sur mesure. Jalapeño n’est toutefois pas encore disponible en volume : il faudra attendre les premiers racks fin 2026 pour juger son comportement en production.

Une architecture « feuille blanche » et une stratégie d’intégration verticale

Pour fabriquer Jalapeño, OpenAI a choisi une puce entièrement repensée, sans moteurs graphiques hérités du gaming. Une équipe dirigée par Richard Ho, ex-architecte des TPU chez Google, s’est attaquée aux goulets d’étranglement propres à l’inférence : la gestion du KV-cache, la bande passante mémoire et le trafic réseau.

Ingénieurs en salle blanche examinant une grande tranche de silicium et des schémas d’architecture de puce sur des écrans dans un laboratoire de semi-conducteurs.
Jalapeño a été conçue de zéro avec TSMC, Broadcom et Celestica pour la fabriquer et l’intégrer en racks.

Des partenaires industriels aux rôles précis

La fabrication est confiée à TSMC en gravure 3 nm. La puce, presque à la limite du réticule avec 840 mm² de silicium, embarque la nouvelle mémoire HBM4. Broadcom a réalisé la conception physique et fourni ses contrôleurs réseau Tomahawk. Celestica assemble les racks. La production répartit ainsi les rôles entre le fondeur, le concepteur réseau et l’assembleur.

9 à 16 mois pour passer du concept au tape-out

La vitesse de développement compte autant que la performance. Avec l’aide de Codex et des modèles de génération de code d’OpenAI, l’équipe matérielle est passée du concept au tape-out en 9 à 16 mois, contre souvent près de deux ans dans l’industrie. L’IA a notamment servi à écrire le code RTL et à vérifier les circuits : les modèles accélèrent désormais la conception de la puce qui les exécutera.

Réduire les coûts sur un marché sous tension

L’enjeu est d’abord financier. Selon SemiAnalysis, le coût total de possession par token servi pourrait être divisé par 3 à 5 par rapport aux clusters GPU classiques. L’opération réduit aussi la dépendance à NVIDIA. OpenAI continuera d’utiliser des GPU pour entraîner ses modèles de pointe, mais prévoit de réserver Jalapeño à l’inférence grand public et professionnelle, qui concentre les coûts récurrents. 10 GW de puissance devraient être déployés entre 2026 et 2029, selon l’accord avec Broadcom.

Des agents plus rapides, des API moins chères

Pour les entreprises, la baisse du coût par token rend des flottes d’agents autonomes plus abordables. Pour les développeurs, une latence jusqu’à 3,6× plus faible peut rendre les échanges conversationnels plus naturels. Les premiers racks Jalapeño doivent entrer en service fin 2026, avant une montée en charge prévue en 2027. La deuxième génération, déjà planifiée sur le nœud TSMC A16, est déjà dans les cartons.

Jalapeño marque la première incursion d’OpenAI dans le silicium. Si les chiffres se confirment en production, NVIDIA devra répondre sur le terrain de l’inférence, où le coût par token et la latence comptent autant que la puissance brute.


Sur le même Thème :

Laisser un commentaire

Trop d’infos IA ?

Inscrivez-vous à la newsletter pour recevoir un résumé hebdomadaire directement dans ta boite email (et rien d’autre)