Jalapeño: o chip de inferência da OpenAI com até 1,9x mais eficiência que a Nvidia

TL;DR: A OpenAI detalhou o Jalapeño, seu primeiro chip próprio de inferência, desenvolvido com a Broadcom. Segundo benchmarks divulgados pela empresa e analisados pela SemiAnalysis, o chip entrega de 1,5 a 1,9 vez mais desempenho por watt do que os aceleradores atuais da Nvidia. Para quem usa ChatGPT e a API da OpenAI, isso pode significar respostas mais rápidas e custos menores no médio prazo. A implantação em produção está prevista para o fim de 2026.

O que aconteceu

Jalapeño é o codinome do primeiro chip de inferência de IA projetado pela OpenAI em parceria com a Broadcom. Em 25 de agosto de 2026, a OpenAI publicou os primeiros benchmarks detalhados do chip. O projeto começou em meados de 2024. Foi da formação da equipe até o tape-out (a etapa final de design antes da fabricação) em cerca de 16 meses, segundo a análise da SemiAnalysis.

Principais números, segundo a SemiAnalysis e a TechCrunch:

Métrica Jalapeño (stepping B0)
Processo de fabricação TSMC N3P
Memória HBM4, 15,4 TB/s de banda
Desempenho MXFP4 13,4 PFLOPs a 700 W
Tokens/s por usuário (DeepSeek R1) mais de 700
Tokens/s por usuário (GPT-OSS) cerca de 1.400

Nos dois pontos em que a OpenAI publicou comparação direta com a Nvidia, a vantagem do Jalapeño aparece clara: em desempenho MXFP4, o chip consome 700 W contra os 900-1.150 W do Rubin em cargas comparáveis; em desempenho por watt, medido nas cargas GPT-OSS, DeepSeek R1 e Kimi K2.5 1T, a vantagem varia de 1,5x a 1,9x a favor do Jalapeño.

A SemiAnalysis destaca ainda que a OpenAI usou o Codex, seu próprio modelo de codificação, para otimizar partes do design do chip, reduzindo em 8% a área dos blocos SIMD e em 10% a do motor de multiplicação de matrizes, os componentes que fazem o grosso do trabalho matemático em inferência de IA.

A OpenAI afirma que o Jalapeño começa a ser implantado na própria infraestrutura até o fim de 2026, inicialmente para rodar cargas internas antes de qualquer uso em produtos voltados ao público.

Por que isso importa

O Jalapeño importa porque parece ser uma das primeiras vezes que uma empresa que só fazia software de IA publica números concretos de um chip próprio competindo diretamente com a Nvidia. Não é só uma promessa de roadmap. São benchmarks já divulgados pela própria OpenAI e analisados por veículos especializados, com cargas de trabalho reais.

Até aqui, a Nvidia dominava a inferência de modelos grandes quase sem concorrência séria. Google tem a família TPU há anos, mas voltada majoritariamente para uso interno. Amazon e Microsoft também têm projetos de silício próprio, mas nenhum publicou uma comparação direta de desempenho por watt tão detalhada quanto a que a SemiAnalysis descreve agora para o Jalapeño.

A diferença de eficiência energética, de 1,5x a 1,9x por watt, importa mais do que parece à primeira vista. Data centers de IA são hoje limitados por energia, não só por capital: a conta que decide quantos chips um provedor consegue operar é a de watts disponíveis num galpão, não só de dólares no orçamento. Um chip que faz o mesmo trabalho com menos energia permite instalar mais capacidade de inferência no mesmo espaço físico, o que se traduz em custo por token mais baixo.

Esse movimento também chega em um momento delicado para o mercado de hardware de IA. Fabricantes de servidores avisaram Microsoft, Google e Oracle sobre um aumento de preço nos próximos sistemas da Nvidia. As configurações Vera Rubin e Grace Blackwell devem subir mais de 15% a partir dos embarques do início de 2027, puxadas pelo custo crescente de memória, segundo reportagem do Tom’s Hardware. Ter uma alternativa própria de silício dá à OpenAI uma carta de negociação que ela não tinha até agora, mesmo que a Nvidia continue sendo, de longe, a maior fornecedora de capacidade de IA do mundo. É um movimento parecido com o que levou a Nvidia a comprar a Hugging Face: grandes players de IA buscando controlar mais elos da própria cadeia de fornecimento.

O que isso significa para quem usa ChatGPT e a API da OpenAI

Para o usuário comum do ChatGPT, e para desenvolvedores que constroem produtos sobre a API da OpenAI, o Jalapeño não muda nada hoje. A implantação em produção só deve começar perto do fim de 2026, e inicialmente em escala limitada.

Respostas potencialmente mais rápidas

Os números de tokens por segundo por usuário divulgados (mais de 700 no DeepSeek R1 e cerca de 1.400 no GPT-OSS) são relevantes para quem sente lentidão em respostas longas ou em uso via API com alto volume. Se a OpenAI conseguir migrar parte da carga de inferência para o Jalapeño, o efeito prático tende a aparecer como respostas mais ágeis nos momentos de pico de uso, quando a demanda por GPU costuma gerar filas.

Pressão para baixo nos preços da API

Chips mais eficientes por watt reduzem o custo de servir cada token gerado. Historicamente, ganhos de eficiência de infraestrutura da OpenAI já se refletiram em cortes de preço na API ao longo do tempo. Não é garantido que isso se repita agora, mas é o padrão que o mercado tem observado. Vale acompanhar os anúncios de preço da OpenAI nos próximos meses.

Menos dependência de um único fornecedor de hardware

Isso é mais relevante para empresas que dependem da API da OpenAI em produção do que para o usuário final: um fornecedor de IA com opção própria de silício, além da Nvidia, tende a estar menos exposto a atrasos de fornecimento ou aumentos de preço repentinos de um único parceiro de hardware.

O que a cobertura sobre o Jalapeño costuma deixar passar é que esse tipo de diversificação também dá à OpenAI mais previsibilidade de capacidade. Isso pesa diretamente na estabilidade do serviço que o usuário final recebe, especialmente em janelas de pico como lançamentos de novos modelos, quando a demanda dispara e a capacidade de GPU costuma ser o gargalo.

O que fazer agora

  1. Hoje: se você usa a API da OpenAI em produção, não mude nada: o Jalapeño ainda não está em produção e não há ação técnica necessária agora.
  2. Neste mês: se lentidão em horários de pico é um problema real no seu uso, por exemplo depois do lançamento do GPT-5.6 Sol, documente os horários e padrões. Isso ajuda a avaliar, mais para frente, se a chegada do novo hardware trouxe melhora perceptível.
  3. Neste trimestre: acompanhe anúncios de preço da OpenAI para a API. Ganhos de eficiência de infraestrutura costumam anteceder ajustes de preço, para cima ou para baixo, em um prazo de alguns meses.
  4. Se você depende de um único fornecedor de IA no seu produto: use este anúncio como lembrete para revisar seu plano de contingência: não porque o Jalapeño mude algo hoje, mas porque a diversificação de hardware é um sinal de que o mercado de infraestrutura de IA está menos travado num único fornecedor do que estava há um ano.

Não faça:

O panorama geral

O Jalapeño faz parte de uma tendência maior: as maiores empresas de IA generativa, inclusive a Meta, que tem apostado pesado em infraestrutura própria para sua corrida por superinteligência, estão deixando de depender só da Nvidia para construir capacidade de inferência. Google tem os TPUs, Amazon tem os chips Trainium e Inferentia, e agora a OpenAI tem o Jalapeño, feito com a Broadcom, a mesma parceira de silício por trás dos TPUs do Google.

Esse movimento não significa o fim do domínio da Nvidia. A empresa segue sendo, disparada, a maior fornecedora de chips de IA do mundo: reportou US$ 96,2 bilhões em receita no trimestre encerrado em julho de 2026, o maior resultado trimestral já registrado por uma empresa de tecnologia, segundo a CNBC. Mas sinaliza que o mercado de hardware de IA está entrando numa fase de mais concorrência, o que tende a beneficiar quem compra capacidade de inferência, inclusive, indiretamente, quem paga uma assinatura do ChatGPT ou usa a API da OpenAI.

Perguntas frequentes

O Jalapeño já está em uso no ChatGPT?

Não. A OpenAI só divulgou benchmarks do chip até agora; a implantação em produção está prevista para o fim de 2026, começando por cargas internas.

O Jalapeño substitui os chips da Nvidia na OpenAI?

Não por completo. A OpenAI continua sendo uma das maiores compradoras de GPUs da Nvidia do mundo, a mesma empresa que recentemente comprou a Hugging Face para reforçar sua posição no ecossistema de IA. O Jalapeño é descrito como um complemento voltado especificamente para inferência, não uma substituição total da infraestrutura atual.

Por que a OpenAI decidiu fazer seu próprio chip em vez de só comprar da Nvidia?

Empresas de IA em grande escala buscam reduzir custo por token e depender menos de um único fornecedor à medida que o consumo de energia, não só o preço do hardware, se torna o principal fator limitante para expandir capacidade de inferência.

Referências e notas de apuração