
1. O que são o GPT-6 Sol e o GPT-6 Luna?
2. Como foi o lançamento do GPT-6 Sol e Luna
3. GPT-6 Astra, Sol e Luna: qual a diferença entre os três modelos
4. Benchmarks do GPT-6 Sol e Luna: onde os modelos se destacam
5. Quanto custa o GPT-6 Sol e o que muda no cache de prompts
6. Alinhamento e limites do lançamento
7. Como acessar o GPT-6 Sol e o GPT-6 Luna
8. Conclusão
A OpenAI lançou nesta terça-feira, 22 de setembro de 2026, o GPT-6 Sol e o GPT-6 Luna, dois modelos que completam a nova geração iniciada pelo GPT-6 Astra no começo do mês.
Os dois herdam métodos de treinamento do Astra e chegam à API com preços 50% menores que os valores promocionais da linha GPT-5.6: o GPT-6 Sol sai a US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída.
Com o lançamento, a família passa a ter três degraus. O Astra continua no topo, reservado aos trabalhos mais exigentes. O Sol ocupa a faixa intermediária, voltada a programação e tarefas profissionais complexas. O Luna fica com o volume, em operações nas quais custo e velocidade pesam mais que profundidade de raciocínio.
O argumento central do anúncio é o custo por tarefa concluída. Em quase todos os testes divulgados, a OpenAI compara Sol e Luna com modelos da Anthropic que custam várias vezes mais, e essa comparação chega num momento delicado: o Claude Opus 5.5 foi apresentado 90 minutos antes e ficou fora de todas as tabelas.
Este artigo explica o que são o GPT-6 Sol e o GPT-6 Luna, como foi o lançamento e o que diferencia os três modelos da família. Na sequência, detalha os benchmarks, os preços, as mudanças no cache de prompts e as formas de acesso.
O GPT-6 Sol e o GPT-6 Luna são modelos de linguagem de grande porte (LLMs) desenvolvidos pela OpenAI e lançados em 22 de setembro de 2026 como versões mais rápidas e baratas do GPT-6 Astra. Ambos foram treinados com métodos semelhantes aos do Astra e levam, a um custo menor, parte dos avanços do topo de linha em trabalho profissional, precisão factual, programação, uso de computador e alinhamento.
O GPT-6 Sol é o modelo intermediário da família. Segundo a OpenAI, ele foi desenhado para tarefas de trabalho difíceis, como desenvolvimento de software e fluxos de negócio com várias etapas. A proposta inclui limites de uso maiores e preço inferior ao de concorrentes com desempenho parecido.
Já o GPT-6 Luna é o modelo de entrada. Tem capacidade de raciocínio menor que a dos outros dois, mas foi pensado para operações de alto volume, como resumos e extração de informações. Nesses casos, o custo de cada chamada importa mais que a profundidade da resposta.
Nos dois casos, o usuário escolhe o nível de esforço de raciocínio, que nos testes da OpenAI vai de low a max, passando por medium, high e xhigh. Quanto maior o esforço, mais o modelo pensa antes de responder e mais tokens consome. Na API, os identificadores são gpt-6-sol e gpt-6-luna.
Leia também: GPT-6 Astra: o que é, como funciona e o que muda no novo GPT-6 da OpenAI
O anúncio veio cerca de três semanas depois do Astra, apresentado em 3 de setembro. A OpenAI justifica a expansão pela diferença entre tipos de trabalho: os projetos mais exigentes ainda pedem a profundidade do Astra, mas boa parte do uso real acontece em escalas, ritmos e orçamentos menores, e é para essa fatia que Sol e Luna foram lançados.
Os nomes podem confundir quem acompanha a empresa. Na geração anterior, o GPT-5.6 Sol era o modelo mais capaz da OpenAI, lançado em junho com acesso restrito, e a família tinha ainda o Terra e o Luna.
No GPT-6, o topo passa ao Astra, o Sol desce para a faixa intermediária e o anúncio não menciona um sucessor do Terra. O nome, portanto, indica a posição do modelo dentro de cada geração, e não uma linha contínua de capacidade.
A disputa com a Anthropic ajuda a explicar o tom do lançamento. Como registrou o Canaltech, a concorrente havia apresentado o Claude Opus 5.5 pouco antes, com preço menor e desempenho próximo ao do Fable 5.1. A OpenAI respondeu com o mesmo tipo de argumento: capacidade por dólar gasto.
A liberação no ChatGPT foi gradual. A empresa informou que distribuiria os modelos ao longo do dia de lançamento para manter o serviço estável, e orientou quem não encontrasse as novas opções a tentar mais tarde.
A diferença entre os modelos aparece primeiro no preço. Na API, os valores por milhão de tokens ficam assim (OpenAI e Tecnoblog, 2026):
A distância entre os degraus é grande. O Sol custa um quinto do Astra, e o Luna custa um vigésimo do Sol. Em relação ao GPT-5.6, o Sol caiu de US$ 4 para US$ 2 na entrada e de US$ 20 para US$ 10 na saída. Já o Luna passou de US$ 0,20 para US$ 0,10 e de US$ 1,20 para US$ 0,50.
A OpenAI atribui a redução a melhorias de cache e de inferência, que baixaram o custo de servir os modelos, e afirma repassar essa economia aos clientes. Ao mesmo tempo, mantém a recomendação de usar o Astra quando o melhor resultado possível é a prioridade.
Na prática, escolher entre os três vira um exercício de distribuição de tarefas. Um mesmo produto pode usar o Luna para resumir documentos em volume e o Sol para as etapas de programação e análise. O Astra fica reservado aos poucos casos em que a precisão compensa pagar cinco vezes mais por token.
Todos os números desta seção foram divulgados pela OpenAI no anúncio do lançamento (2026). A empresa informa que usou relatórios públicos para os concorrentes e, quando não havia dado do Claude Fable 5.1, os resultados do Fable 5. Até a publicação deste texto, não havia avaliação independente comparando os modelos nas mesmas condições.
No AutomationBench, teste da Zapier que avalia agentes em fluxos de negócio com 47 ferramentas de áreas como vendas, finanças e RH, o GPT-6 Sol no esforço xhigh fez 33,2%, a US$ 0,27 por tarefa. O Astra em esforço baixo ficou em 30,3%, custando 3,9 vezes mais. O Claude Opus 5 em esforço máximo marcou 26,9%, a 11,1 vezes o custo, e o Fable 5.1 chegou a 31,4%, com custo pelo menos 8,9 vezes maior.
O dado do Fable pede leitura cuidadosa. A própria OpenAI avisa que o número subestima o custo real, porque não inclui as vezes em que o modelo recorreu ao Opus 5. Isso aconteceu em cerca de 40% das tarefas. No mesmo teste, o GPT-6 Luna em esforço alto melhorou 5,4 pontos percentuais sobre o antecessor, com custo por tarefa 58% menor.
No Agents' Last Exam, que mede o desempenho de agentes em tarefas profissionais longas de 55 subsetores, o Sol em esforço máximo marcou 56,4%. O resultado supera a maior nota do Opus 5 na avaliação, com custo por tarefa 60% menor.
O FrontierCode, da Cognition, avalia se o código escrito por um agente está pronto para ser incorporado a uma base real, considerando qualidade dos testes, estilo e aderência aos padrões do projeto. Nele, o Sol empata com o Fable 5.1 em esforço xhigh a um custo bem menor, segundo a OpenAI, que não detalha o valor.
No DeepSWE v1.1, de tarefas longas de engenharia de software, o Sol em esforço máximo fez 68,8%, a 1,1 ponto do Fable 5 em xhigh (69,9%), com custo por tarefa cerca de 80% menor. O Luna chegou a 66,6%, patamar comparável ao de Opus 5 e Fable 5 em esforço médio, custando 93% menos que o primeiro e 96% menos que o segundo.
O Astra segue como o modelo da OpenAI para operar um computador de forma autônoma. Ainda assim, no OSWorld 2.0 offline, o Sol em xhigh marcou 60,5%, praticamente empatado com o Opus 5 em esforço médio (60,3%), com custo cerca de 80% menor. Na mesma prova, o Luna em esforço máximo superou o GPT-5.6 Sol em esforço médio gastando um décimo.
A OpenAI mede a factualidade, isto é, a capacidade de fornecer informações corretas, com conversas reais anonimizadas em que usuários apontaram erros de modelos anteriores. Nesse teste, o Sol comete cerca de metade dos erros do antecessor e se aproxima da confiabilidade do Astra. O Luna, em esforço alto, iguala o GPT-5.6 Sol a cerca de um centésimo do custo.
A empresa ressalva que essas conversas foram selecionadas justamente por terem induzido erro, e por isso não representam o uso típico, em que falhas factuais são mais raras.
O concorrente mais recente não aparece em nenhum confronto. Todos usam o Opus 5, lançado em julho, e não o Opus 5.5, anunciado no mesmo dia. No relatório da própria Anthropic, o Opus 5.5 marcou 40% no AutomationBench. Como cada laboratório roda os testes com versões e configurações próprias, porém, os números não são diretamente comparáveis.
Por isso, os benchmarks funcionam melhor como indicação de faixa do que como ranking. O que eles sustentam com consistência é a relação entre custo e desempenho: em vários testes, Sol e Luna ficam perto de modelos que custam de cinco a mais de vinte vezes mais por tarefa.
Tokens são as unidades de texto pelas quais os modelos de IA são cobrados. Em agentes de IA e conversas longas, boa parte desses tokens se repete a cada passo, porque o modelo relê o mesmo contexto: instruções, documentos e histórico. O cache de prompts guarda esse trecho já processado e cobra menos para reaproveitá-lo. No GPT-6, a leitura de tokens em cache tem desconto de 90%.
A OpenAI afirma ter aumentado a taxa de acerto do cache por padrão e lançou ferramentas para acompanhar o aproveitamento. O Prompt Caching Dashboard mostra quanto da entrada está em cache ao longo do tempo, e uma ferramenta de diagnóstico aponta oportunidades perdidas e o que corrigir. Desenvolvedores também podem definir explicitamente onde termina o trecho armazenado.
A mudança com mais efeito prático para agentes, porém, é outra. Agora é possível aumentar ou reduzir o esforço de raciocínio e ativar ou desativar ferramentas no meio de uma conversa sem perder o contexto já guardado em cache. O GitHub, citado pela OpenAI, relata que essas melhorias reduziram em mais de 50% a parcela de tokens que precisavam de processamento novo no Copilot. A medição cobre bilhões de requisições.
A escala do consumo explica a ênfase. Dentro da própria OpenAI, calculado a preço de API, o uso diário de tokens passou de US$ 600 por pesquisador na mediana e de US$ 7.000 no grupo dos 10% que mais consomem. Quando um agente de programação trabalha horas numa tarefa, o preço por token e a taxa de cache decidem se a automação cabe no orçamento.
Sol e Luna herdam o trabalho de alinhamento do Astra, que a OpenAI apresenta como seu modelo mais alinhado. Nas avaliações da empresa, os dois melhoram em relação às versões GPT-5.6, com menos afirmações enganosas sobre o trabalho de programação que executaram. O Canaltech destaca ainda resultados melhores em testes que medem tentativas de contornar avisos de segurança.
Esses testes foram desenhados para provocar falhas e não medem a frequência de problemas no uso comum, como a própria OpenAI observa. Os resultados completos estão no system card do Astra, e não em um documento específico dos novos modelos.
Há também lacunas no anúncio. Os benchmarks são autodeclarados e comparam os modelos com versões anteriores da concorrência, o texto não informa a janela de contexto dos modelos e a disponibilidade ainda é parcial: o Sol não chegou à interface comum de chat, e usuários dos planos gratuitos só acessam o Luna pelo aplicativo para desktop.
No ChatGPT, os dois modelos estão disponíveis no ChatGPT Work e no Codex, o agente de programação da OpenAI, para assinantes dos planos Plus, Pro, Business, Enterprise e Edu. Usuários dos planos Free e Go têm acesso ao GPT-6 Luna pelo aplicativo para desktop. Na interface padrão de chat, na web e no celular, os novos modelos ainda não aparecem.
Para desenvolvedores, os modelos estão na API da OpenAI como gpt-6-sol e gpt-6-luna, com os preços por token descritos acima e o desconto de 90% na leitura de cache.
Quem usa os modelos no dia a dia também deve notar respostas mais curtas. A OpenAI levou ao Sol e ao Luna o estilo de comunicação do Astra, com menos jargão e menos detalhes de pouco valor. O modelo também passa a deixar mais claro o que fez e o que deixou de verificar, sobretudo em conversas técnicas.
Em síntese, o GPT-6 Sol e o GPT-6 Luna levam para faixas de preço mais baixas a geração que o Astra inaugurou. Os dois ficam abaixo do topo de linha em capacidade, mas chegam perto dele, e de concorrentes mais caros, custando uma fração por tarefa.
Em resumo, a OpenAI passou a competir menos pela nota máxima e mais pelo custo de cada tarefa concluída, mesma direção que a Anthropic tomou com o Opus 5.5. Preço, cache e nível de esforço entram juntos nesse cálculo: o token mais barato reduz a conta direta, o cache que resiste a ajustes corta o reprocessamento em agentes longos e o esforço escolhido por etapa concentra o raciocínio onde ele faz diferença.
Para as empresas, a consequência prática é distribuir tarefas entre vários modelos em vez de concentrar tudo em um só. Com três degraus de preço separados por fatores de cinco e de vinte, rodar tudo no modelo mais caro vira desperdício mensurável. No sentido oposto, rodar tudo no mais barato expõe a operação a erros justamente nas etapas críticas.
Os benchmarks ainda são autodeclarados, e uma comparação do GPT-6 Sol com o Opus 5.5 e o Fable 5.1 nas mesmas condições deve aparecer nas próximas semanas. Até lá, o critério mais confiável é testar os modelos com as próprias tarefas e medir o custo por resultado entregue.
Quem opera agentes em produção tem uma revisão pendente: redistribuir tarefas entre modelos e recalcular o orçamento de tokens com os novos preços. Para acompanhar lançamentos que chegam com horas de diferença e entender o que cada um muda de fato, assine a AI Factory News e receba toda semana a análise do Distrito sobre modelos, agentes e lançamentos de IA.