
1. O que é o Holo4?
2. H Company: a startup francesa por trás do Holo4
3. Como funciona o Holo4: tela, código, MCP e API em um só modelo
4. Holo4 nos benchmarks: onde chega perto e onde fica atrás
5. Quanto custa e como acessar o Holo4
6. Riscos e limites do Holo4 para uso corporativo
7. Quando o Holo4 faz sentido para empresas
8. Conclusão
A H Company lançou nesta segunda-feira, 28 de setembro de 2026, o Holo4, sua nova família de modelos para agentes que operam computadores. O laboratório francês de inteligência artificial foi fundado por ex-pesquisadores da DeepMind. O anúncio saiu no mesmo dia do Claude Sonnet 5.5, da Anthropic, e os dois disputam o mesmo tipo de tarefa: fazer um agente de IA clicar, digitar, escrever código e chamar ferramentas para concluir um trabalho de ponta a ponta dentro de um software.
O que diferencia o Holo4 é a combinação de tamanho e interface. Os dois modelos da família são pequenos para os padrões atuais, com 27 e 35 bilhões de parâmetros. Mesmo assim, foram treinados para usar a tela, o terminal, servidores MCP e APIs de negócio sem trocar de modelo.
Os pesos estão publicados no Hugging Face. Nos testes de fluxos longos, o custo por tarefa divulgado pela empresa fica entre um sétimo e um décimo do cobrado pelos modelos fechados mais avançados. A contrapartida é o desempenho: nesses mesmos fluxos, o Holo4 ainda fica cerca de 20 pontos atrás do Claude Opus 5.5.
Este artigo explica o que é o Holo4, quem é a H Company e como o modelo funciona por dentro. Na sequência, detalha os benchmarks, com as ressalvas que a própria empresa publica. Por fim, trata de preços, licenças (que não são iguais para as duas versões) e dos casos em que o modelo faz sentido para uma operação corporativa.
O Holo4 é uma família de modelos de visão e linguagem (VLM) desenvolvida pela H Company para computer use. Essa é a categoria de agentes de IA que operam softwares a partir do que enxergam na tela. Lançado em 28 de setembro de 2026, o modelo recebe capturas de tela e resultados de ferramentas, e decide a próxima ação. A resposta volta como clique, digitação, código ou chamada de API, que um programa se encarrega de executar. A janela de contexto é de 256 mil tokens.
A família tem duas versões. O Holo4 27B é um modelo denso, construído sobre o Qwen3.8 27B, da Alibaba. É o carro-chefe da linha, com a melhor precisão em tarefas longas e de várias etapas. O Holo4 35B-A3B usa arquitetura Mixture of Experts (MoE) sobre o Qwen3.6: tem 35 bilhões de parâmetros no total, mas ativa apenas 3 bilhões por token. Isso o torna mais rápido e mais barato, com precisão um pouco menor.
As duas versões estão na H Models API, a API paga da empresa. Os pesos também estão publicados no Hugging Face em quatro formatos: BF16, FP8, NVFP4 e GGUF de 4 bits. A empresa também abriu todas as trajetórias por trás das notas nos benchmarks públicos. Qualquer pessoa pode reproduzir, passo a passo, o que o agente fez em cada teste.
Junto com o Holo4, a H Company lançou o Holotron4 Nano, sucessor do Holotron 3. Ele aplica a mesma receita de pós-treinamento ao Nemotron 3 Nano Omni, modelo aberto da NVIDIA, e serve como prova de que o método não depende da família Qwen. A empresa integra a Nemotron Coalition, iniciativa da NVIDIA para ampliar o uso dos modelos Nemotron.
Os ganhos sobre o modelo base são grandes em interface gráfica. No OSWorld, o Holotron4 Nano sai de 21% para 76,3%, e no AutomationBench, que mede automação com ferramentas MCP, passa de 19,4% para 35,6%. Em fluxos longos que misturam tela e código, porém, o resultado continua baixo: 7,9% no OSWorld 2.0. É um modelo para tarefas curtas, não para substituir o Holo4 27B.
A H Company nasceu em Paris em 2023, fundada por cinco pesquisadores da DeepMind em torno de uma tese específica. Para eles, a pesquisa de ponta em IA quase nunca chegava à operação diária das empresas, que roda em navegadores, softwares de desktop e sistemas antigos, boa parte deles sem API. A proposta desde o início foi construir agentes que operam essas interfaces diretamente, como uma pessoa faria.
Em 2024, a empresa captou mais de 200 milhões de euros em uma rodada com Accel, UiPath, Bpifrance, Bernard Arnault e Eric Schmidt, entre outros. A presença da UiPath, líder em automação robótica de processos (RPA), diz bastante sobre o mercado que a H Company mira: o dos robôs de software que hoje seguem roteiros fixos e quebram quando a tela muda.
Os primeiros modelos vieram em 2025. O Holo1 foi lançado com o Surfer-H, um agente de navegação web, e foi seguido pelo Holo1.5 e pelo Holo2, ano em que Gautier Cloix assumiu como CEO. Em 2026 vieram o Holo3, a H Platform (com a Models API e a Agents API), a extensão HoloTab para o Chrome e as primeiras implantações em empresas, segundo a página institucional da H Company.
O posicionamento é o de um laboratório europeu que não tenta competir com OpenAI e Anthropic em modelos gerais. A aposta está em um nicho, o uso de computador em ambiente corporativo. Para isso, a empresa tem certificações SOC 2 Type II e ISO 27001 e segue o GDPR, o regulamento europeu de proteção de dados. Para uma empresa europeia, essa é uma escolha sensata: disputar a fronteira geral exige um volume de capital que nenhum laboratório do continente tem hoje.
Computer use é a capacidade de um modelo de IA operar um computador pela interface gráfica, do mesmo jeito que uma pessoa. O agente recebe uma captura da tela, identifica botões, campos e menus, decide o que fazer e executa a ação: clicar, digitar, rolar a página, abrir um programa. Depois, observa a nova tela e repete o ciclo até concluir a tarefa ou esbarrar em algo que não sabe resolver.
Essa abordagem existe porque boa parte do trabalho corporativo acontece em sistemas que não foram feitos para conversar com outros sistemas. Um ERP antigo, um portal de fornecedor ou um software de desktop sem API não podem ser integrados a um agente de IA pelas vias tradicionais. Nesses casos, operar a tela é a única integração possível, e é nesse espaço que a H Company construiu o produto.
A maior parte dos modelos agênticos é treinada para uma interface só. Os especializados em interface gráfica ficam cegos quando não há tela para olhar, e os especializados em chamar ferramentas travam diante de um aplicativo que não oferece API. Um processo real costuma misturar as duas situações, e a solução comum hoje é montar um pipeline com dois modelos, um para cada parte.
O Holo4 foi treinado para escolher sozinho a interface de cada passo. O mesmo modelo, chamado do mesmo jeito, roda em desktop, na web, no Android, em um ambiente isolado de execução de código e contra APIs de negócio.
Na prática, ele pode ler uma planilha por código e preencher um formulário web clicando nos campos. Depois, registra o resultado em um sistema via MCP (Model Context Protocol), o padrão aberto para conectar agentes a ferramentas externas. Para quem mantém a infraestrutura, isso significa um modelo a menos para versionar e monitorar.
O treinamento parte de uma linha de produção interna que a H Company chama de Agentic Task Factory. São pipelines de agentes que constroem ambientes interativos e tarefas verificáveis a partir apenas de documentação: manuais, centrais de ajuda, capturas de tela de sites reais e softwares de código aberto. Até agora, a fábrica produziu cerca de 10 mil tarefas, sendo 4 mil em aplicativos web, 3 mil em servidores MCP e 3 mil em ambientes de desktop.
O controle de qualidade é o que torna esse material útil. Uma tarefa só entra no conjunto se o verificador falhar no estado inicial, passar no estado correto e rejeitar todas as soluções quase certas. Além disso, um agente precisa ter resolvido a tarefa pela interface real. Parte dos ambientes é híbrida e expõe o mesmo estado por interface gráfica e por MCP, o que ensina o modelo a trocar de via no meio do caminho.
O ajuste fino supervisionado usou 127 bilhões de tokens. Cerca de três quartos são trajetórias bem-sucedidas geradas pela fábrica: 45% em desktop, 14% na web, 12% em MCP e APIs e 3% em celular. Em seguida, a empresa treinou por aprendizado por reforço dois especialistas, um para desktop e web e outro para terminal, MCP e API. Os dois foram fundidos de volta ao modelo com peso igual, sem treinamento adicional.
O harness é o programa que executa as ações pedidas pelo modelo, devolve o resultado e gerencia o contexto ao longo de centenas de passos. A H Company o reconstruiu em paralelo ao treinamento, usando o próprio OSWorld 2.0 como guia: agentes classificavam por que cada tarefa falhava, e engenheiros revisavam as correções propostas. Ao longo de agosto e setembro, o limite de cada execução subiu de 200 para 500 passos e de 2 para 6 horas.
As duas mudanças de maior impacto foram uma memória capaz de acompanhar centenas de passos e um shell rodando na própria máquina desktop. Na última versão, o agente passa a controlar o computador também pelo terminal, com uma única ferramenta para código e cliques. Isso amplia bastante o que ele consegue fazer, e também o que ele consegue estragar, ponto que volta mais adiante na discussão sobre riscos.
Todos os números desta seção foram divulgados pela H Company no anúncio do Holo4 (2026). As notas do Holo4 vêm do harness da própria empresa, como média de duas a quatro execuções. As dos concorrentes são públicas e foram medidas por terceiros, em harnesses e níveis de esforço diferentes. Até a publicação deste texto, não havia avaliação independente nas mesmas condições.
O número que a H Company destaca no título do anúncio é 85,2% no OSWorld, benchmark de tarefas de computador mais curtas, a US$ 0,08 por tarefa. O Holo4 35B-A3B marca 80,8% a US$ 0,05. Nesse teste, o 27B fica perto do Claude Fable 5 (86%) e acima do GPT-5.5 (78,7%). Também fica bem próximo do próprio modelo base, o Qwen3.8 27B (84,3%, a US$ 0,22). Aqui, o ganho do pós-treinamento aparece mais no custo do que na nota.
O OSWorld 2.0 mede fluxos longos e é o teste que separa os modelos. O Holo4 27B marca 61,7% de pontuação parcial e 41,5% de tarefas concluídas, a US$ 1,22 por tarefa. O Claude Opus 5.5 chega a 81,8% (48,7% de sucesso) a US$ 8,48, e o GPT-6 Astra, a 73,5% a US$ 9,07. O 35B-A3B cai para 30,9%, sinal de que a versão menor não aguenta tarefas longas.
A leitura honesta é que o Holo4 27B fica 20 pontos atrás do Claude Opus 5.5 nos fluxos longos, custando cerca de um sétimo por tarefa. Na taxa de sucesso, a distância cai para sete pontos. Quem cita só o 85,2% passa a impressão de empate com a fronteira. Já quem cita só o 61,7% ignora que o modelo resolve tarefas curtas quase tão bem quanto os melhores.
Nos demais testes, o padrão se repete: o Holo4 27B fica próximo dos modelos fechados em tarefas delimitadas e atrás em trabalho especializado longo, com custo muito menor em todos os casos:
O AutomationBench pede uma ressalva que está na nota de rodapé do anúncio. A H Company coletou dados de treino de 480 das 600 tarefas públicas do teste. Nas 120 que ficaram de fora, o Holo4 27B marca 49,3%, número mais confiável para comparar. Os concorrentes, por sua vez, têm notas do conjunto público, mas custos medidos no conjunto privado do ranking oficial, onde o Holo4 ainda não foi avaliado.
A empresa publicou três tarefas comparando o Holo4 27B com o Qwen3.8 27B, com o mesmo prompt e o mesmo harness. O caso mais citado é a criação de um jogo no estilo Pac-Man na engine Godot, que precisava rodar sozinho, sem teclado. O Holo4 concluiu em 68 chamadas e 2,4 milhões de tokens; o Qwen base precisou de 197 chamadas e 11,4 milhões de tokens.
Na modelagem 3D do logo da H Company no FreeCAD, a diferença foi menor, 94 contra 118 chamadas. Já na réplica da Torre Eiffel no mesmo programa, o Holo4 usou mais: 84 chamadas e 1,3 milhão de tokens, contra 60 chamadas e 1 milhão do Qwen. A qualidade final de cada resultado depende de inspeção visual, disponível em vídeo no anúncio. O ganho em eficiência é real, mas não aparece em toda tarefa.
Mais relevante do que os três exemplos é a decisão de abrir as trajetórias. Poucos laboratórios publicam o passo a passo de cada execução por trás das notas. Com esse material, equipes técnicas podem verificar onde o modelo acerta e onde se perde antes de apostar nele.
Na H Models API, o Holo4 27B custa US$ 0,40 por milhão de tokens de entrada (US$ 0,04 com cache) e US$ 3 por milhão de tokens de saída. O Holo4 35B-A3B sai por US$ 0,30 na entrada (US$ 0,03 com cache) e US$ 2 na saída. Para comparação, o Claude Opus 5.5 cobra US$ 4 e US$ 20: dez vezes mais na entrada e quase sete vezes mais na saída do que o Holo4 27B.
A API é compatível com o formato da OpenAI, o que permite trocar de modelo mudando o endereço e o identificador em uma aplicação já existente. A H Company oferece a opção de retenção zero de dados e um plano gratuito para começar. Para quem quer apenas ver como um agente de computer use se comporta, há a extensão HoloTab, gratuita e sem cadastro. Ela roda o Holo4 no próprio Chrome para tarefas como responder e-mails ou preparar a agenda do dia.
Esse é o ponto que mais pesa para uma empresa e o que mais se perde na cobertura do lançamento. Os pesos das duas versões estão públicos, mas sob licenças diferentes. O Holo4 35B-A3B usa a Apache 2.0, que permite uso comercial, modificação e hospedagem própria. O Holo4 27B, a versão com os melhores resultados, sai sob CC BY-NC 4.0, que proíbe uso comercial dos pesos, conforme o model card do Holo4 27B.
Na prática, uma empresa que quiser o 27B em produção precisa usar a API paga. Quem quiser hospedar o modelo na própria infraestrutura, para manter os dados dentro de casa, fica com o 35B-A3B, que é justamente o que cai para 30,9% no OSWorld 2.0. Por isso o termo mais preciso para o lançamento é "modelo de pesos abertos", e não open source no sentido pleno.
Os pesos rodam com Transformers, vLLM e SGLang. A H Company também mantém um harness próprio de código aberto, o hai-agents, que envia as capturas de tela ao modelo e executa as ações pedidas. As versões quantizadas, em especial a GGUF de 4 bits, reduzem a memória necessária, embora o modelo denso de 27B em precisão cheia ainda exija uma GPU com bastante VRAM. A empresa promete para os próximos dias checkpoints auxiliares que devem acelerar a inferência.
O primeiro risco vem da própria capacidade que torna o modelo útil. Com um shell na máquina, o agente pode abrir o terminal e rodar comandos diretamente, não só clicar na tela. Como observou o iMasters, o material da H Company não detalha como isolar o ambiente nem como limitar permissões, e essa parte fica com quem integra o modelo.
Para uma empresa, isso define o desenho da implantação. Um agente que opera computador precisa rodar em máquina virtual ou contêiner isolado, com credenciais de escopo mínimo e registro de cada ação. Operações irreversíveis, como pagamentos, exclusões e envios externos, pedem aprovação humana. Sem essa camada, o custo baixo por tarefa vira risco operacional alto.
O segundo limite é a distância nos fluxos longos. Em uma automação de desktop extensa, em que cada falha exige retrabalho manual, 20 pontos a menos no OSWorld 2.0 pesam mais do que a economia por tarefa. O terceiro é a origem dos números. Todos os resultados são autodeclarados, e parte das comparações mistura harnesses, versões de teste e conjuntos de dados diferentes, como a própria empresa admite nas notas dos gráficos.
O Holo4 rende mais em tarefas de alto volume e escopo delimitado. São casos em que o custo por execução pesa no orçamento e o erro é fácil de detectar. Conferência de cadastros, extração de dados de portais sem API, preenchimento de formulários em sistemas legados e rotinas repetitivas em aplicativos de desktop se encaixam nesse perfil. Nesses casos, a diferença de acerto pode ser compensada com nova tentativa automática ou com uma pessoa revisando o resultado.
Para fluxos longos e críticos, os modelos fechados de fronteira continuam na frente, e a decisão tende a ser de roteamento, não de substituição. O arranjo mais racional usa o Holo4 no volume e reserva um modelo como o Opus 5.5 para as etapas em que a falha custa caro. Montar essa divisão exige critérios de roteamento, monitoramento de custo por tarefa e integração com os sistemas da empresa. São as mesmas condições para levar agentes de IA do piloto à produção.
Há ainda um uso menos óbvio. Para equipes que querem entender computer use antes de contratar uma plataforma, o Holo4 é uma base de teste barata e transparente. As trajetórias abertas mostram como um agente desse tipo erra, algo que os fornecedores de modelos fechados raramente expõem.
Em síntese, o Holo4 coloca a H Company na disputa por agentes de computer use com uma proposta clara. São modelos pequenos, capazes de alternar entre tela, código, MCP e API, a um custo por tarefa várias vezes menor que o dos modelos fechados. Em tarefas curtas, o Holo4 27B chega perto da fronteira. Nos fluxos longos, fica 20 pontos atrás do Opus 5.5, e a versão menor não acompanha.
Em resumo, o lançamento se sustenta em um modelo único para todas as interfaces e em um custo por tarefa baixo o bastante para automação em volume. A transparência sobre como o agente se comporta, rara no setor, reforça a proposta. A licença, porém, redesenha essa conta: o modelo mais forte só pode ser usado comercialmente pela API, e o que pode ser hospedado internamente é o mais fraco nos fluxos longos.
Para as empresas, o efeito prático é um novo degrau de preço na automação de sistemas sem API. Esse espaço, até aqui, era ocupado por RPA com roteiros fixos e por modelos fechados caros. A tendência é que o custo de operar interfaces gráficas com IA continue caindo. Com isso, a diferença entre as opções tende a se deslocar para a camada de controle: isolamento, permissões, auditoria e roteamento entre modelos.
Os números do Holo4 ainda precisam de avaliação independente, e o ranking oficial do AutomationBench deve trazer a primeira comparação nas mesmas condições. Até lá, o critério mais confiável é testar o modelo com as próprias tarefas, em ambiente isolado, e medir o custo por resultado entregue.
Quem avalia agentes para operar sistemas legados tem uma comparação pendente entre modelos abertos e fechados, e ela muda a cada lançamento. Para acompanhar esses lançamentos e entender o que cada um muda de fato, assine a AI Factory News e receba toda semana a análise do Distrito sobre modelos, agentes e lançamentos de IA.