Símbolo da openai atravessado por linhas de velocidade em uma composição laranja e preta

OpenAI apresenta modo Ultrafast, que acelera GPT-5.6 Sol em até 14 vezes

Avatar de bruno martinez
Prévia limitada da API usa chips da Cerebras para gerar até 750 tokens por segundo. Veja como funciona o Ultrafast do GPT-5.6 Sol.

A OpenAI apresentou o Ultrafast, um novo nível de serviço que executa o GPT-5.6 Sol em até 14 vezes a velocidade do processamento padrão. Disponível inicialmente em uma prévia limitada da API, o modo usa infraestrutura da Cerebras para gerar até 750 tokens de saída por segundo e mira tarefas em que alguns segundos de espera mudam o resultado.

O que muda com o Ultrafast?

Gráfico oficial compara inteligência e velocidade e destaca o ultrafast em 750 tokens por segundo
O GPT-5.6 Sol Ultrafast alcança até 750 tokens de saída por segundo, segundo a Cerebras. (Imagem: Cerebras/Reprodução)

O Ultrafast não é um novo modelo de linguagem. Trata-se de uma camada de processamento mais veloz para o GPT-5.6 Sol, modelo que a OpenAI apresenta como o mais inteligente de sua linha atual. A empresa afirma que o serviço chega a 750 tokens de saída por segundo e pode funcionar até 14 vezes mais rápido que o modo Standard.

Tokens são as pequenas unidades de texto processadas e geradas por um modelo. Uma taxa maior significa que uma resposta longa aparece mais rapidamente depois que a geração começa. Isso não garante, porém, que toda tarefa terminará exatamente 14 vezes antes: a latência total também depende do tamanho do pedido, das ferramentas conectadas, da rede e do tempo necessário para analisar dados externos.

A proposta é oferecer a capacidade completa do Sol sem obrigar empresas a migrar para um modelo menor quando precisam de respostas em tempo real. O avanço complementa o lançamento da família GPT-5.6, formada por Sol, Terra e Luna, com perfis diferentes de desempenho e custo.

Onde a velocidade pode fazer diferença

Gráfico oficial compara o tempo total do gpt-5. 6 sol ultrafast e do gpt-5. 6 sol no benchmark gdp-val
Em seis tarefas do GDP-Val com qualidade equivalente, o Ultrafast reduziu o tempo médio total de 7,7 minutos para 83 segundos. (Imagem: Cerebras/Reprodução)

Na fase de testes, a OpenAI trabalha com um grupo inicial de empresas de programação, comércio, pesquisa financeira e atendimento. A companhia também usa o modo internamente para observar como uma redução de ordem de grandeza no tempo de resposta modifica fluxos reais de trabalho.

  • Resposta a incidentes: ler registros, mudanças recentes no código e conversas da equipe enquanto uma falha ainda está em andamento, ajudando a levantar causas prováveis e validar uma correção.
  • Finanças e segurança: acompanhar sinais de mercado, avaliar transações e identificar atividades suspeitas enquanto as condições continuam mudando.
  • Atendimento e voz: consultar diferentes sistemas e resolver solicitações complexas sem interromper a conversa com o cliente.
  • Comércio eletrônico: verificar estoque, personalizar recomendações e solucionar problemas no checkout antes que o consumidor abandone a compra.
  • Pesquisa: transformar ciclos que antes rodavam durante a noite em sessões interativas, com novas hipóteses testadas ao longo do mesmo dia.

Esses cenários não eliminam a necessidade de supervisão humana. No exemplo de incidentes, a própria OpenAI ressalta que engenheiros continuam responsáveis pelo julgamento e pela implantação de mudanças. A aceleração serve para reduzir o intervalo entre observar um sinal, testar uma hipótese e decidir o próximo passo. Integrações como o Codex com uso do computador e ferramentas conectadas mostram por que a latência pode se tornar decisiva em agentes que executam várias etapas.

Parceria com a Cerebras e disponibilidade

Pesquisador segura o processador wafer scale engine 3 da cerebras
A infraestrutura da Cerebras usa processadores Wafer Scale Engine para acelerar a inferência de modelos de inteligência artificial. (Imagem: Cerebras/Reprodução)

O desempenho é sustentado pela Cerebras, empresa especializada em aceleradores de IA de grande escala. A parceria já buscava levar inferência de baixa latência à plataforma da OpenAI e agora passa a atender o GPT-5.6 Sol. Em vez de alterar o modelo, o Ultrafast muda a infraestrutura usada para executar a geração.

Por enquanto, o acesso está restrito a clientes selecionados da OpenAI API. A empresa abriu um formulário para organizações interessadas e diz que ampliará a disponibilidade conforme a capacidade crescer. Não há data para uma liberação geral, preço divulgado nem confirmação de chegada ao ChatGPT. Como referência, os preços normais da API da família foram atualizados recentemente; o Showmetech detalhou quanto custam GPT-5.6 Sol, Terra e Luna.

Assim, o anúncio deve ser lido como uma prévia técnica e comercial, não como um recurso já disponível para qualquer desenvolvedor. Seu impacto dependerá do preço final, da capacidade oferecida e de quanto os ganhos medidos na geração de texto reduzirão o tempo completo de aplicações conectadas a bancos de dados, sistemas corporativos e ferramentas externas.

Fontes: OpenAI; Cerebras; TechCrunch.

Veja também

Deixe um comentário
Posts Relacionados