O que aconteceu
O time de Frontier Red Team da Anthropic publicou, em 29 de setembro de 2026, o relatório “GLM-5.3 and the spread of advanced cyber capabilities”, assinado por Andrew Fasano, Marius Fleischer, Cole McFaul, Robert Xiao e Tripp Gallagher. O documento testa o GLM-5.3, modelo mais recente da chinesa Zhipu AI (marca comercial Z.ai), em benchmarks de exploração de vulnerabilidades e o compara diretamente com o próprio Claude Mythos Preview.
Conclusão central do relatório O GLM-5.3 representa “uma mudança de patamar nas capacidades cibernéticas disponíveis a atacantes” e deve permitir que atores estatais e não estatais causem dano real, o que o distingue de outros modelos de capacidade parecida lançados com salvaguardas ou acesso restrito.
Os números de capacidade bruta mostram as duas IAs praticamente empatadas. No ExploitBench, benchmark que mede a construção autônoma de exploits de ponta a ponta, o GLM-5.3 teve sucesso em 50 de 410 tentativas (12%), contra 56 de 410 (14%) do Claude Mythos Preview. Em um benchmark interno de exploração binária, a diferença também é pequena: 4% contra 6%. Para efeito de comparação histórica, a Anthropic registra que modelos anteriores, como o próprio Claude Opus 4.6 e a geração anterior do rival, o GLM-5.2, não passaram de 0% de sucesso nesses mesmos testes.
| Métrica | GLM-5.3 | Claude Mythos Preview |
|---|---|---|
| ExploitBench (exploits ponta a ponta) | 12% (50/410) | 14% (56/410) |
| Benchmark interno de exploração binária | 4% | 6% |
| Acesso ao modelo | Peso aberto, download livre | Fechado, acesso controlado |
| Versão com menos travas | Pública dias após o lançamento | Restrita a usuários vetados |
A diferença entre os dois modelos está na resistência a pedidos maliciosos, não na capacidade técnica. A Anthropic testou quatro formas de pedir ao GLM-5.3 que construísse um exploit: pedido direto (0% de engajamento), pretexto disfarçado de “exercício de red team” (64%), tokens de raciocínio pré-preenchidos manipulando o processo de decisão do modelo (92%) e uma versão “ablitada”, com os mecanismos de recusa removidos por edição direta dos pesos internos (100%).
Essa ablitação não é um exercício hipotético de laboratório. Segundo o relatório, ela reduziu a taxa de recusa do modelo de 95% para 6% em benchmarks padrão de segurança (JailbreakBench e HarmBench). O custo estimado é de cerca de 2.200 horas de GPU (US$ 4.400) para uma primeira tentativa, caindo para aproximadamente 600 horas (US$ 1.200) para equipes com experiência prévia na técnica. Versões já ablitadas do GLM-5.3 apareceram publicamente poucos dias após o lançamento do modelo pela Zhipu AI.
Por que isso importa
A diferença de capacidade entre os dois modelos é pequena a ponto de ser quase irrelevante. O que separa um risco gerenciável de um risco amplo é o modelo de distribuição. A Anthropic libera o Claude com salvaguardas embutidas, e reserva variantes com proteções reduzidas a usuários cuidadosamente verificados. O GLM-5.3 é de peso aberto: uma vez publicado, qualquer pessoa com GPUs suficientes pode baixar o modelo, aplicar a ablitação e distribuir uma versão sem nenhuma das proteções originais, sem depender da Zhipu AI para liberar nada.
Esse relatório não aparece isolado. Ele chega poucos dias depois de a própria Microsoft publicar seu Digital Defense Report 2026, mostrando que a IA já reduziu para menos de 24 horas o tempo entre a descoberta de uma vulnerabilidade e sua exploração, enquanto empresas levam de 30 a 60 dias para corrigir falhas críticas. O relatório da Anthropic dá um nome e um número concretos a uma parte específica desse problema: um modelo de peso aberto, sem o controle de distribuição que a Anthropic aplica ao próprio Claude, remove a última camada de fricção entre a capacidade técnica e o uso malicioso em escala.
Também é relevante que esse relatório venha da própria Anthropic avaliando um concorrente direto. A empresa tem motivo comercial para destacar riscos em um modelo chinês rival, o que não invalida os números, mas é contexto que vale ter em mente ao ler a conclusão. Ainda assim, a metodologia (mesmos benchmarks aplicados aos dois modelos, com números específicos e reproduzíveis) é mais verificável do que um alerta genérico.
O que isso significa para quem acompanha o setor
A corrida de capacidade entre laboratórios chineses e americanos já inclui cibersegurança ofensiva
Até pouco tempo, comparações entre modelos chineses e americanos giravam em torno de benchmarks de raciocínio, código e custo, como ficou claro quando a DeepSeek dobrou receita e fechou rodada de US$ 7,5 bi antes do IPO. O relatório da Anthropic mostra que a paridade técnica entre os dois polos já alcançou também a capacidade de construir exploits, uma categoria onde a diferença entre “ter a capacidade” e “distribuir a capacidade com controle” pesa mais do que o benchmark em si.
Peso aberto sem salvaguarda é um vetor de risco que reguladores ainda não endereçaram
A FTC abriu investigação sobre a OpenAI, a Anthropic e outras empresas de IA por riscos de agentes autônomos, mas o escrutínio regulatório até agora tem como alvo as grandes empresas americanas, que já publicam salvaguardas e políticas de uso. Um modelo de peso aberto lançado por uma empresa fora da jurisdição americana, sem política de distribuição equivalente, fica fora do alcance prático dessas investigações, mesmo com capacidades de risco comparáveis.
A técnica de ablitação virou parte do ciclo de vida esperado de qualquer modelo aberto poderoso
Com custo de mil a quatro mil dólares em GPU e aparecimento público em poucos dias, a ablitação deixou de ser uma curiosidade acadêmica. Qualquer laboratório que lance um modelo de peso aberto com capacidades ofensivas relevantes deveria assumir, como parte do planejamento de lançamento, que uma versão sem recusas vai circular rapidamente, soltando do controle da empresa qualquer salvaguarda aplicada antes do download.
O que observar a seguir
Vale acompanhar se a Zhipu AI responde publicamente ao relatório da Anthropic, seja contestando a metodologia, seja anunciando alguma mudança na forma como libera pesos de modelos futuros. Também é um ponto a observar se outros laboratórios de IA, americanos ou chineses, com modelos de peso aberto de capacidade comparável (como variantes futuras do DeepSeek ou do Llama) recebem relatórios de red team parecidos, o que indicaria se esse tipo de avaliação cruzada entre concorrentes vai se tornar prática comum no setor. Por fim, vale acompanhar se agências de segurança nacional, fora dos Estados Unidos, passam a tratar a disponibilidade pública de modelos ablitados como um risco de cibersegurança a ser monitorado de forma mais ativa.
Perguntas frequentes
O que é o GLM-5.3? É o modelo de IA mais recente da Zhipu AI (marca comercial Z.ai), uma empresa chinesa, lançado como peso aberto, o que significa que qualquer pessoa pode baixar e modificar o modelo livremente.
O GLM-5.3 é mais capaz que o Claude em hacking? Não. Nos testes da Anthropic, o Claude Mythos Preview teve um desempenho levemente superior (14% contra 12% no ExploitBench, 6% contra 4% em exploração binária). A diferença real está nas salvaguardas, não na capacidade bruta.
O que é “ablitação” (abliteration)? É uma técnica que edita diretamente as matrizes de peso internas de um modelo para remover seus mecanismos de recusa a pedidos maliciosos, sem precisar de um novo treinamento completo. No GLM-5.3, ela reduziu a taxa de recusa de 95% para 6%.
Por que isso é um risco maior no GLM-5.3 do que no Claude? Porque o Claude é distribuído de forma fechada, com salvaguardas que a Anthropic controla, e versões com proteções reduzidas ficam restritas a usuários vetados. Depois que a Zhipu AI publica os pesos do GLM-5.3, ela não tem mais como impedir que terceiros removam as proteções e redistribuam o modelo por conta própria.
Esse relatório é de uma fonte neutra? Não exatamente. É um relatório da Anthropic avaliando um modelo de um concorrente direto, o que é um ponto relevante a considerar. Ainda assim, a metodologia usa benchmarks aplicados de forma idêntica aos dois modelos, com números específicos e verificáveis.
Referências e notas de apuração
- Anthropic. “GLM-5.3 and the spread of advanced cyber capabilities.” Frontier Red Team, 29 de setembro de 2026. https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities (fonte primária, metodologia e todos os números citados nesta matéria).
- Tom’s Hardware. “Anthropic claims popular Chinese AI model has Mythos-class hacking abilities — frontier red teaming report details weak safeguards on open-weight AI.” https://www.tomshardware.com/tech-industry/artificial-intelligence/anthropic-claims-popular-chinese-ai-model-has-mythos-class-hacking-abilities-frontier-red-teaming-report-details-weak-safeguards-on-open-weight-ai
- South China Morning Post. “Anthropic raises alarm over elite hacking ability of Chinese firm Z.ai’s GLM-5.3.” https://www.scmp.com/tech/big-tech/article/3369354/anthropic-raises-alarm-over-elite-hacking-ability-chinese-firm-zais-glm-53
Nota de apuração: todos os números técnicos citados (taxas de sucesso em exploits, taxas de engajamento com pedidos maliciosos, taxas de recusa antes e depois da ablitação, custo em horas de GPU) vêm diretamente do relatório oficial da Anthropic, verificado via acesso ao texto completo na data desta publicação. A cobertura do Tom’s Hardware e do South China Morning Post foi usada para confirmar o enquadramento e a repercussão do relatório, não como fonte de números adicionais.