Voltar

Grok 4.7: o que muda no novo modelo da SpaceXAI e quanto custa

Setembro 2026
Pedro Assis
10 min
Grok 4.7: o que muda no novo modelo da SpaceXAI e quanto custa
Sumário

1. O que é o Grok 4.7?

2. Do Grok 4.5 ao Grok 4.7: o que mudou em dois meses

3. Benchmarks do Grok 4.7: onde lidera e onde fica atrás

4. O Grok 4.7 é mesmo a terceira melhor IA do mundo?

5. Como usar o Grok 4.7: acesso, preços e níveis de raciocínio

6. Segurança, custo real e limites do lançamento

7. O que o Grok 4.7 muda para quem escolhe modelos de IA

Dois meses e meio depois do Grok 4.5, a SpaceXAI chegou à terceira versão da mesma família de modelos. O Grok 4.7, anunciado em 21 de setembro de 2026, é o modelo mais capaz da empresa para programação e trabalho de conhecimento. O preço segue o que a divisão de IA de Elon Musk pratica desde julho: US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída.

Entre as duas versões houve ainda o Grok 4.6, lançado em agosto, que refinou o 4.5 sem trocar o modelo-base. O Grok 4.7 é o primeiro lançamento desde a compra da Cursor pela SpaceX a substituir essa base por uma maior, e chega ao editor de código da Cursor como o modelo principal da plataforma.

Para empresas, o dado que pesa neste lançamento é a relação entre capacidade e custo. O Grok 4.7 lidera poucos testes de engenharia, mas fica perto dos líderes cobrando uma fração do preço, o que altera a conta de quem roda agentes de programação em volume.

Os números divulgados pela SpaceXAI e as primeiras avaliações independentes mostram onde essa conta fecha e onde ela ainda depende do tipo de tarefa.

O que é o Grok 4.7?

O Grok 4.7 é o modelo de linguagem de fronteira da SpaceXAI, divisão de inteligência artificial da SpaceX. Foi desenvolvido para programação, tarefas agênticas de longa duração e trabalho de conhecimento, como a produção de documentos, planilhas e apresentações. Sua proposta é sustentar tarefas que levam horas, verificando o próprio trabalho ao longo da execução, com preço inferior ao dos modelos que disputam a mesma faixa de desempenho.

O modelo aceita texto e imagem como entrada, responde em texto e permite escolher entre quatro níveis de raciocínio: low, medium, high (o padrão) e xhigh. O corte de conhecimento é maio de 2026, e o acesso pela API funciona tanto pela Responses API quanto pelo padrão Chat Completions, segundo a documentação técnica da SpaceXAI.

Na prática, o modelo move três produtos do mesmo grupo: o Cursor, editor de código com IA que o trata como seu modelo de fronteira; o Grok Build, agente de linha de comando da SpaceXAI; e o Grok Bot, agente de execução de tarefas cujo ambiente de trabalho o modelo foi treinado para entender de forma nativa.

Do Grok 4.5 ao Grok 4.7: o que mudou em dois meses

A família atual do Grok evoluiu em três passos curtos. O Grok 4.5, lançado em 8 de julho, foi o primeiro modelo da SpaceXAI com foco declarado em programação e treinado com dados de uso do Cursor. O Grok 4.6 veio em agosto com a mesma base e concentrou os ganhos em seguir instruções detalhadas e em sustentar execuções agênticas mais longas.

O Grok 4.7 muda a fundação. De acordo com o anúncio oficial da SpaceXAI, o modelo usa uma base nova e maior do que a do 4.6. Também passou por uma rodada mais longa de aprendizado por reforço, com tarefas mais difíceis e peso maior para problemas que levam muitas horas para serem concluídos.

O efeito descrito pela empresa aparece em duas frentes que se reforçam: o modelo verifica melhor o próprio trabalho e lida com contextos longos de forma mais confiável. Uma tarefa de várias horas acumula contexto e, com ele, erros que precisam ser pegos antes da entrega.

Há ainda uma mudança menos visível, relevante para quem integra o modelo a produtos. Os níveis de raciocínio ficaram mais separados entre si do que no 4.6, segundo a documentação do Cursor, e tarefas difíceis passam mais tempo em processamento quando o esforço é elevado. Com isso, a escolha do nível de esforço vira uma decisão de custo mais explícita.

O preço, por outro lado, não acompanhou a troca de base. O Grok 4.7 é servido ao mesmo preço e na mesma velocidade do Grok 4.6, que já repetia os valores do 4.5, e a SpaceXAI mantém uma variante rápida com o dobro da velocidade de saída pelo dobro do preço.

Benchmarks do Grok 4.7: onde lidera e onde fica atrás

A SpaceXAI comparou o Grok 4.7, no nível de esforço xhigh, com o Grok 4.6, com o GPT-5.6 Sol da OpenAI e com o Claude Fable 5.1 da Anthropic, os dois últimos em modo máximo. Nos sete testes da tabela divulgada pela empresa em setembro de 2026, o modelo lidera em dois e fica em segundo lugar em outros quatro.

Programação e engenharia

  • CursorBench 4.0: benchmark do Cursor voltado a tarefas de programação de longa duração. O modelo marcou 46,3%, contra 40,4% do Grok 4.6 e 41,7% do GPT-5.6 Sol, enquanto o Claude Fable 5.1 lidera com 51,8%.
  • DeepSWE v1.1: teste de engenharia de software em que o modelo chegou a 71% (em esforço high), perto dos 72,7% do GPT-5.6 Sol e acima dos 70% do Claude Fable 5.1.
  • Terminal-Bench 4.0: mede trabalho de várias horas no terminal. O modelo praticamente empata com o GPT-5.6 Sol (37,6% contra 37,3%), mas fica distante do Claude Fable 5.1, que registrou 57,9%.
  • EEBench: avalia tarefas de engenharia elétrica. É o teste em que o modelo abre a maior vantagem, com 64%, contra 56,4% do Claude Fable 5.1 e 39,4% do GPT-5.6 Sol.

O salto sobre o Grok 4.6 no Terminal-Bench, de 20,3% para 37,6%, é o maior avanço da tabela e o que melhor traduz a promessa de trabalhar por mais tempo sem perder o fio da tarefa. A distância para o Fable 5.1 no mesmo teste, contudo, mostra que a liderança em tarefas longas de terminal continua com a Anthropic.

Trabalho profissional de várias horas

Fora do código, a SpaceXAI destaca a produção de documentos e apresentações. No AA Briefcase, que simula tarefas de várias horas realizadas por profissionais como advogados, enfermeiros e analistas financeiros, o modelo somou 1.657 pontos, contra 1.678 do Claude Fable 5.1 e 1.487 do GPT-5.6 Sol. No GDPval, em pontuação Elo, registrou 1.695, atrás dos 1.735 do Fable 5.1 e à frente dos 1.542 do GPT-6 Astra.

Os resultados setoriais são mais irregulares. No benchmark de agentes jurídicos da Harvey, ele lidera com 19,6%, contra 6,7% do Fable 5.1 e 2,5% do GPT-5.6 Sol. Os números baixos de todos os modelos, no entanto, indicam um teste ainda muito difícil para qualquer um deles. Em raciocínio clínico, no HealthBench Professional, o modelo fica em terceiro, com 56,7%.

AI Factory News · Curadoria Semanal

Acompanhe a evolução acelerada dos modelos de código e IA com análise crítica

Do Grok 4.7 a novos benchmarks de engenharia: receba toda quinta-feira as análises do Distrito sobre os principais lançamentos e o impacto real no custo e capacidade das empresas.

Modelos de Código · Benchmarks · Gratuito
Assinar a AI Factory News
Análises acionáveis do Distrito para orientar revisões de arquitetura e tecnologia em 5 minutos de leitura.

O Grok 4.7 é mesmo a terceira melhor IA do mundo?

A frase que acompanhou o lançamento vem de Elon Musk: o Grok 4.7 teria colocado a SpaceXAI em terceiro lugar entre os laboratórios de programação agêntica, atrás de Anthropic e OpenAI. A afirmação tem base, mas vale para um recorte específico, como detalhou a cobertura do Canaltech sobre as avaliações da Artificial Analysis.

No Coding Agent Index da Artificial Analysis, que avalia modelos rodando nas ferramentas de seus próprios desenvolvedores, o Grok 4.7 com o Grok Build marcou 56 pontos, nove a mais que a geração anterior. Ficou atrás apenas do Claude Fable 5.1, do GPT-6 Astra e do Claude Opus 5. Como dois desses três modelos são da Anthropic, a leitura por laboratório coloca a SpaceXAI em terceiro, e é daí que vem a frase de Musk.

No índice geral, a posição é outra. No Artificial Analysis Intelligence Index, que agrega tarefas de naturezas diferentes, o modelo recebeu 46 pontos e aparece bem mais abaixo no ranking. É competitivo em programação agêntica e em trabalho profissional longo, mas quem procura um assistente de uso geral encontra opções mais bem colocadas.

Como usar o Grok 4.7: acesso, preços e níveis de raciocínio

O modelo está disponível desde o lançamento no Cursor, no Grok Build, na API da SpaceXAI e em ferramentas de terceiros, incluindo harnesses de programação, roteadores de modelos como o OpenRouter e plataformas de nuvem como Vercel e Cloudflare. Para um primeiro teste sem custo, a SpaceXAI oferece acesso gratuito pelo Grok Build.

Na API, a tabela padrão cobra US$ 2 por milhão de tokens de IA na entrada e US$ 6 por milhão na saída, abaixo do GPT-5.6 Sol (US$ 4 e US$ 20) e bem abaixo do Claude Fable 5.1 (US$ 10 e US$ 50). No Cursor, a entrada em cache custa US$ 0,50 por milhão, e a variante Fast sai por US$ 4 e US$ 12.

O tamanho da janela de contexto e o ponto em que o preço sobe variam conforme a plataforma. A documentação da SpaceXAI informa janela de 500 mil tokens. Na documentação do Cursor, a janela padrão é de 256 mil tokens, com modo de contexto longo até 500 mil. Requisições com entrada acima de 256 mil tokens passam a ser cobradas em dobro.

O Canaltech, por sua vez, reporta que a API da SpaceXAI eleva o preço para US$ 4 e US$ 12 a partir de 200 mil tokens de contexto. Para quem pretende processar bases de código ou documentos extensos, confirmar esse limite na plataforma escolhida evita surpresas na fatura.

Os quatro níveis de raciocínio funcionam como um controle de custo: o padrão é high, e o xhigh reserva mais tempo de processamento para os problemas mais difíceis. No plano Start do Cursor, porém, o modelo roda em esforço medium fixo e sem o modo Fast. Escolher o nível ou ativar a variante rápida exige o plano Pro ou superior.

Segurança, custo real e limites do lançamento

A SpaceXAI apresenta o novo modelo como o mais resistente a jailbreaks que já testou, construído sobre um conjunto de salvaguardas inteiramente novo. Em cibersegurança, a empresa informa que o modelo deixa passar apenas 3,3% dos pedidos arriscados de uso duplo no HackerBench v0.3, e em biossegurança lidera o teste da LatchBio, com 62,4%.

Parceiros selecionados de cibersegurança também receberam acesso, por convite, às capacidades de red team do modelo para pesquisa defensiva. Para uma família de modelos que já enfrentou repercussão negativa por respostas de versões anteriores, a ênfase em segurança responde a uma objeção recorrente de compradores corporativos. Ainda assim, o HackerBench é um benchmark interno, e os números de segurança não passaram por verificação independente.

O ponto de atenção mais concreto vem justamente da avaliação externa. A Artificial Analysis observou que o Grok 4.7 pode consumir muitos tokens e apresentar velocidade de saída relativamente baixa em determinados testes. Na geração 4.5, o principal argumento da SpaceXAI era a eficiência por tarefa; se o 4.7 gasta mais tokens para chegar ao resultado, parte da vantagem do preço por token se dilui no custo total de cada tarefa longa.

O que o Grok 4.7 muda para quem escolhe modelos de IA

Em síntese, o Grok 4.7 consolida a SpaceXAI como a opção de menor custo entre os modelos que disputam programação agêntica e trabalho profissional longo. Ele não tira do Claude Fable 5.1 a liderança nas tarefas mais difíceis. Fica, porém, perto o bastante em boa parte delas para que a diferença de preço, de mais de oito vezes na saída, pese na escolha.

Esse equilíbrio depende de três variáveis que o lançamento deixa em aberto: quantos tokens o modelo de fato consome por tarefa, qual janela de contexto e qual tabela valem na plataforma usada, e quanto das melhorias se confirma fora dos testes da própria empresa. As três só se respondem medindo o modelo nas tarefas que a operação já executa.

Para quem decide, a consequência prática é que usar um único modelo para tudo ficou mais caro do que parece. Um agente de programação que roda centenas de tarefas por dia pode ter no modelo da SpaceXAI um custo bem menor com diferença pequena de qualidade. Trabalho longo de terminal e raciocínio clínico, por outro lado, ainda favorecem outros modelos, segundo os próprios números da SpaceXAI.

O ritmo de lançamentos também entra na conta. Foram três versões em menos de três meses, e a próxima deve reorganizar a tabela de novo. Times que mantêm uma rotina de avaliação e roteamento por tipo de tarefa absorvem cada novo modelo em dias, enquanto quem escolhe fornecedor por reputação tende a operar sempre uma versão atrás.

A decisão pendente, para a maioria das empresas, é com que frequência revisar os modelos em uso. Conheça a AI Factory News, newsletter de inteligência artificial do Distrito, e receba toda quinta-feira os principais lançamentos e movimentos do mercado de IA para orientar essa revisão.