Claude Code o Codex: cuál usar, y por qué la respuesta puede ser los dos
Respuesta corta: los dos son buenos y fallan en lugares distintos, que es justo por lo que vale usar ambos. Si debes elegir uno, el criterio práctico no es la calidad del código: es qué suscripción ya pagas y en qué ecosistema ya vives. Si no debes elegir, ejecuta los dos en el mismo proyecto y usa su desacuerdo como revisión.
Claude Code frente a Codex es la pregunta más hecha sobre agentes de IA de programación, y casi todas las respuestas acaban en empate con una lista de pros y contras. Este texto intenta ser útil de otra forma.
Dónde aparece la diferencia de verdad
En las tareas cotidianas, los dos resuelven. La diferencia aparece en los extremos, y es de temperamento más que de capacidad: uno tiende a ser conservador y explicar antes de cambiar, el otro tiende a actuar y mostrarte el resultado. Cuál es mejor depende por completo de si estás explorando un problema o ejecutando algo ya decidido.
Esto cambia con cada versión de ambos lados, por eso las comparaciones de calidad envejecen en semanas. Un criterio que no envejece: cuál ya está pagado en tu cuenta.
Por qué usar los dos gana a elegir
Pedirle una revisión al modelo que escribió el código es pedirle que encuentre un error que no vio mientras escribía. Dos modelos de la misma empresa dan dos versiones de una opinión. Dos de empresas distintas discrepan, y donde discrepan hay un mapa de lo que merece tu atención.
En la práctica: uno implementa, el otro revisa. El segundo encuentra cosas que el primero daba por resueltas, y el coste de enterarte es una pregunta en vez de un error en producción.
Cuánto cuesta ejecutar los dos
Menos de lo que parece, porque ambas herramientas corren sobre suscripciones que probablemente ya tienes. Sin clave de API ni consumo por token: cada CLI usa la sesión autenticada de su propia suscripción. Si ya pagas Claude y ChatGPT, usar ambos en el mismo proyecto no cuesta nada más.
¿Se pueden ejecutar los dos en el mismo repositorio?
Sí, con una precaución: no pueden editar los mismos archivos a la vez. Dos agentes de IA en el mismo directorio se sobrescriben sin ningún error en pantalla, y te enteras media hora después. La solución estándar es darle a cada uno su copia del proyecto, en una rama separada, con git worktree.
También está el detalle de los archivos de instrucciones: Claude Code lee CLAUDE.md y Codex lee AGENTS.md. Mantener ambos con el mismo contenido duplicado es la receta para que diverjan.
¿Cuál es mejor para código grande y antiguo?
Ninguno resuelve solo un repositorio grande sin tu ayuda. Lo que decide no es el modelo, es cuánto se explica tu proyecto a sí mismo: un buen archivo de instrucciones, comandos de prueba que funcionan y una estructura de carpetas que dice qué es qué. Con eso, los dos sirven. Sin eso, ninguno.
¿Y Gemini CLI y Grok?
Entran en la misma lógica. El argumento de usar más de uno no es sobre cuáles dos, es sobre no depender de una sola opinión. Cuanto más distintos los orígenes, más útil el desacuerdo.
¿Entonces cuál elegir?
Si tiene que ser uno: el que esté en la suscripción que ya pagas, y el que encaje con lo que ya usas. Cambiar después cuesta poco, porque ambas herramientas leen el repositorio en vez de guardar estado propio.
Si puedes tener los dos: tenlos, y deja de tratarlo como una elección. La ganancia no está en tener el mejor agente de IA, está en tener dos que discrepan.