Claude Code ou Codex: qual usar, e por que a resposta pode ser os dois
Resposta curta: os dois são bons e erram em lugares diferentes, que é exatamente o motivo de valer usar os dois. Se você precisa escolher um, o critério prático não é qualidade de código: é qual assinatura você já paga e qual ecossistema você já usa. Se não precisa escolher, rode os dois no mesmo projeto e use a discordância entre eles como revisão.
A comparação entre Claude Code e Codex é a pergunta mais feita sobre agentes de IA de programação, e a maioria das respostas termina em empate com uma lista de prós e contras. Este texto tenta ser útil de outro jeito.
Onde a diferença aparece de verdade
Nas tarefas comuns, os dois resolvem. A diferença aparece nos extremos, e é uma diferença de temperamento mais do que de capacidade: um tende a ser mais conservador e explicar antes de mudar, o outro tende a agir e mostrar o resultado. Qual dos dois é melhor depende inteiramente de você estar explorando um problema ou executando algo já decidido.
Isso muda a cada versão dos dois lados, e é por isso que comparação de qualidade envelhece em semanas. Um critério que não envelhece: quem já está pago na sua conta.
Por que usar os dois é melhor que escolher
Pedir revisão ao mesmo modelo que escreveu o código é pedir que ele encontre um erro que não enxergou enquanto escrevia. Dois modelos da mesma empresa dão duas versões da mesma opinião. Dois de empresas diferentes discordam, e os pontos onde discordam são um mapa do que merece a sua atenção.
Na prática: um implementa, o outro revisa. O segundo encontra coisas que o primeiro considerou resolvidas, e o custo de descobrir isso é uma pergunta em vez de um bug em produção.
Quanto custa rodar os dois
Menos do que parece, porque as duas ferramentas rodam nas assinaturas que você provavelmente já tem. Não é preciso chave de API nem consumo por token: cada CLI usa a sessão autenticada da própria assinatura. Se você já paga Claude e ChatGPT, o custo de usar os dois no mesmo projeto é zero a mais.
Dá para rodar os dois no mesmo repositório?
Dá, e o cuidado é um só: eles não podem editar os mesmos arquivos ao mesmo tempo. Dois agentes de IA no mesmo diretório se sobrescrevem sem nenhum erro na tela, e você descobre meia hora depois. A solução padrão é dar a cada um a sua cópia do projeto, em uma branch separada, com git worktree.
Há também o detalhe dos arquivos de instrução: o Claude Code lê CLAUDE.md e o Codex lê AGENTS.md. Manter os dois com o mesmo conteúdo duplicado é a receita para eles divergirem.
Qual é melhor para código grande e antigo?
Nenhum dos dois resolve sozinho um repositório grande sem ajuda sua. O que decide não é o modelo, é o quanto o seu projeto explica a si mesmo: um arquivo de instruções bom, comandos de teste que rodam, e uma estrutura de pastas que diz o que é o quê. Com isso, os dois funcionam. Sem isso, nenhum dos dois.
E o Gemini CLI e o Grok?
Entram na mesma lógica. O argumento de usar mais de um não é sobre quais dois, é sobre não depender de uma opinião só. Quanto mais diferentes as origens, mais útil a discordância.
Então qual escolher?
Se for um só: o que estiver na assinatura que você já paga, e o que se integrar melhor ao que você já usa. Trocar depois custa pouco, porque as duas ferramentas leem o repositório em vez de guardar estado próprio.
Se puder ter os dois: tenha, e pare de tratar isso como uma escolha. O ganho não está em ter o melhor agente de IA, está em ter dois que discordam.