Modelos de ponta encontraram as vulnerabilidades. Só o atacante encontrou as cadeias.
7 de outubro de 2026
0 minutos de leituraOs invasores não leem seu repositório: eles acessam sua URL e encadeiam tudo o que encontram. Em uma era em que a IA ofensiva ataca aplicações em produção na velocidade das máquinas, suas ferramentas de segurança precisam ir além de encontrar vulnerabilidades: precisam comprovar a explorabilidade, inclusive se elas podem ser combinadas para causar uma violação.
Então, fizemos um teste. Direcionamos o Evo Continuous Offensive Security (COS) e o Claude Security com Mythos para a mesma aplicação: TaintedPort. É um aplicativo web intencionalmente vulnerável que reproduz classes de bugs do mundo real e um conjunto de cadeias de exploração conhecidas. São ferramentas de tipos diferentes: o COS ataca a aplicação em execução, enquanto os dois produtos Claude analisam o código-fonte. Usamos o mesmo alvo para descobrir o que cada abordagem consegue comprovar.
O Evo COS confirmou 10 das 15 cadeias de exploração.
Isto não é uma crítica aos modelos — nós os usamos
O Claude Security com Mythos representa um avanço real na descoberta de vulnerabilidades com IA. Ele analisa o código-fonte como um bom revisor humano e detecta classes de falhas que ferramentas baseadas em correspondência de padrões deixam passar. Mas encontrar uma falha no código e comprovar que um invasor pode explorar essas vulnerabilidades são tarefas diferentes.
O caminho de ataque comprovado pelo COS
Todas as ferramentas deste teste encontraram a falha de falsificação de solicitação do lado do servidor (SSRF) e identificaram que o segredo de assinatura JWT da aplicação estava codificado diretamente no código. O Evo COS foi além: usou a SSRF para acessar e recuperar o segredo de assinatura da aplicação em execução. Em seguida, usou esse segredo para criar um token de administrador válido e assumir o controle da área administrativa. Duas descobertas, conectadas em um caminho completo de tomada de conta, foram demonstradas contra a aplicação em produção com uma prova de conceito executável.

Acima: CHAIN-004 conforme pontuada para o COS. Todas as ferramentas deste teste relataram individualmente as duas descobertas que a compõem: a falha de SSRF e o segredo codificado diretamente no código. O Evo COS confirmou que elas podem ser combinadas para forjar um token de administrador.
É assim que um ataque autônomo acontece na prática: conquistar um ponto de acesso e, a partir dele, encadear outros ataques. O Evo COS mostra o caminho e inclui uma prova de conceito executável para cada cadeia confirmada.
Resultados
TaintedPort v1.35, avaliado com base em um gabarito fixo de 57 vulnerabilidades conhecidas e 15 cadeias de exploração conhecidas, em uma escala ponderada por gravidade (Baixa 1, Média 3, Alta 9, Crítica 27; cada cadeia confirmada foi pontuada com sua própria gravidade, além das descobertas que a compõem). A detecção ponderada é calculada por pontos encontrados ÷ 938 pontos disponíveis: 587 das 57 vulnerabilidades e 351 das 15 cadeias.
Evo COS | Claude Security (Mythos) | |
|---|---|---|
Detecção ponderada por gravidade | 75,7% | 49,6% |
Cadeias de exploração confirmadas (de 15) | 10 | X |
Vulnerabilidades encontradas (de 57) | 50 | 37 |
F1 | 91,7% | 75,5% |
O Claude Security encontrou mais uma vulnerabilidade de gravidade crítica (10 contra 9). O Evo COS encontrou o maior número de vulnerabilidades, teve a maior precisão (96,2% contra 90,2%), com menos falsos positivos, e conseguiu identificar e comprovar cadeias de exploração.
Por que atacar a aplicação em produção?
O Evo COS é um sistema dinâmico: seu alvo é sempre uma URL ativa, e o código-fonte é uma entrada opcional que transforma uma execução de caixa-preta em caixa-cinza. Ele nunca atua apenas sobre o código. O Claude Security foi executado em modo caixa-branca (somente código).
Essa é uma comparação entre disciplinas diferentes: o Evo COS é um teste de intrusão ofensivo que investiga e explora a aplicação em execução, um processo fundamentalmente mais intensivo do que uma única análise de código. É a mesma divisão complementar que sempre existiu no setor entre DAST e SAST. Aqui, mostramos o que testar a aplicação em produção comprova — e o que analisar apenas o código não consegue: que essas vulnerabilidades são reais e podem ser encadeadas.
As descobertas relatadas apenas pelo Evo COS são, em sua maioria, comportamentos em tempo de execução: respostas refletidas e mal configuradas, ausência de proteções de transporte, tokens que continuam válidos após o logout e gerenciamento fraco de sessões. O Evo COS conseguiu confirmar várias falhas de lógica de negócios dependentes do contexto: autorização quebrada em nível de objeto em atualizações de perfil, escalonamento de privilégios por meio de declarações JWT forjadas e uma falha crítica em que uma única leitura de um segredo TOTP armazenado anula a autenticação de dois fatores. As cadeias exigem chegar a cada etapa pela aplicação em execução e confirmar que a próxima etapa pode ser realmente alcançada. Um modelo que analisa o código precisa inferir se uma vulnerabilidade é executada — e deixa passar a cadeia.
Você pode criar um harness, mas não pode criar o contexto
O debate deste ano sobre benchmarks chegou a uma conclusão válida: o sistema ao redor de um modelo importa mais do que o próprio modelo. Vamos além. “Qual harness?” não é uma pergunta neutra — e a resposta é onde está a verdadeira vantagem.
O Evo COS orquestra vários modelos, incluindo os modelos Claude de ponta, cada um direcionado à tarefa que executa melhor. Portanto, esse resultado não é uma história sobre a qualidade dos modelos. A mesma classe de modelo que impulsiona uma revisão de código de ponta faz parte do Evo COS. O que muda é o sistema ao redor: o Evo COS parte do que a plataforma Snyk já sabe sobre o alvo, em vez de começar do zero; reúne um grupo de agentes, cada um orquestrado para uma finalidade específica, e cada descoberta passa por uma etapa independente de validação antes de ser apresentada, porque o sistema que gera uma descoberta não deve ser o mesmo que a avalia.
Qualquer pessoa pode conectar um modelo de ponta a um agente de programação hoje à noite e direcioná-lo a um repositório. Mas essa configuração não consegue reproduzir o contexto acumulado e validado com que o Evo COS começa, o validador independente nem os testes contra a aplicação em produção.
Testes dinâmicos e estáticos são complementares
O Claude Security detectou várias vulnerabilidades que o Evo COS não encontrou, principalmente falhas de lógica e criptografia visíveis no código-fonte que nem sempre aparecem na aplicação em execução. Nenhuma das abordagens é completa por si só; esse é o argumento a favor de uma plataforma em vez de uma ferramenta pontual. Analisar o código e atacar a aplicação em execução permite que cada abordagem encontre o que a outra não encontra.
Metodologia
TaintedPort é uma aplicação intencionalmente vulnerável da própria Snyk, criada e mantida pela nossa equipe e disponível publicamente. O Evo COS não foi ajustado para ela.
Alvo: TaintedPort: 57 vulnerabilidades conhecidas (34 comuns, 23 de lógica de negócios) e 15 cadeias de exploração conhecidas.
Ferramentas e entradas:
Evo COS: caixa-cinza (URL ativa + código-fonte), 18 de setembro.
Claude Security: caixa-branca (código-fonte), Mythos com raciocínio estendido, 18 de setembro.
Execuções: uma por ferramenta. Os resultados são os dados de uma única execução, não medianas.
Detecção por categoria
Categoria | Conhecidas | Evo COS | Claude Security (Mythos) |
Comuns | 34 | 33 | 21 |
Lógica de negócios | 23 | 17 | 16 |
Cadeias de exploração | 15 | 10 | X |
Detecção por gravidade (encontradas/conhecidas)
Gravidade | Conhecidas | Evo COS | Claude Security (Mythos) |
Crítica | 11 | 9 | 10 |
Alta | 26 | 22 | 19 |
Média | 18 | 17 | 8 |
Baixa | 2 | 2 | 0 |
Falsos positivos e F1
Métrica | Evo COS | Claude Security (Mythos) |
Falsos positivos | 2 | 4 |
Pontuação F1 | 91,7% | 75,5% |
Reproduza: TaintedPort está disponível em taintedport.com.
Quer saber quais descobertas nas suas próprias aplicações podem ser encadeadas para causar uma violação? Veja como o Evo Continuous Offensive Security testa sua URL ativa.
AGENDE UMA DEMONSTRAÇÃO AO VIVO
Adote IA com segurança em larga escala
A Evo ajuda as organizações a adotar e expandir o uso da IA com segurança, oferecendo visibilidade, governança e proteção para o desenvolvimento impulsionado por IA e as aplicações de IA.
