Claude Code, Cursor, Copilot o Codex: cuál elegir según tu flujo de trabajo
Desde que se escribieron las últimas comparativas de estos cuatro agentes, cada fabricante cambió de modelo insignia al menos dos veces: Claude pasó de Opus 4.6 a Opus 4.8 y de ahí a Opus 5 (su predecesor directo, según el propio anuncio de Anthropic), OpenAI de GPT-5.3-Codex a la familia GPT-5.6. Lo que cambió de verdad no es solo el marcador, sino las reglas del marcador: Anthropic y OpenAI ya no publican sus resultados en el mismo benchmark, así que una tabla única de "rendimiento" ya no es honesta ni posible. Esto es lo que sí se puede comparar hoy, y cómo decidir con ello.
Qué elegir según tu perfil
Antes de cualquier tabla de benchmarks, la decisión real depende de dónde vive tu trabajo y de qué tipo de tarea repites más:
| Tu situación | Herramienta | Por qué |
|---|---|---|
| Refactors grandes en un repo que ya conoces, terminal como hábitat | Claude Code | Ventana de contexto de 1M tokens en Opus 5/Sonnet 5, pensado para sesiones largas sobre un repo entero, no para ediciones puntuales |
| El IDE es tu centro de trabajo y no quieres salir de él para nada | Cursor | Composer 2.5 como modelo por defecto barato para ediciones rápidas, con acceso a modelos frontera (Claude, GPT, Gemini) cuando la tarea lo pide |
| Ya vives en GitHub y quieres que el agente abra el PR él solo | GitHub Copilot (coding agent) | Nativo del flujo de PR/Issues; a fecha de hoy, en los planes de pago el catálogo incluye modelos de Anthropic, OpenAI y Google, aunque cuáles exactamente ves depende de tu plan, tu organización y el despliegue gradual de cada modelo — no es un acceso garantizado ni uniforme |
| Tareas largas y desatendidas: lanzar y volver en una hora | OpenAI Codex | Sandbox en la nube pensado para ejecución asíncrona; el CLI local es la misma familia de modelos, pero el valor diferencial está en el modo cloud |
| Ya pagas una suscripción con IA para otra cosa (ChatGPT Pro, Claude Max) | La que ya tienes | Las cuatro comparten proveedor de modelo con otras suscripciones que probablemente ya pagas; apilar una segunda rara vez compensa antes de agotar la que tienes |
Ninguna de estas decisiones depende de qué modelo saca dos puntos más en un benchmark. Depende de dónde ya vive tu flujo de trabajo y de si la tarea es una edición puntual, un refactor de repo completo o un encargo que puedes dejar corriendo solo.
Los benchmarks dejaron de ser comparables entre sí
En febrero de 2026, comparar Claude Opus 4.6 contra GPT-5.3-Codex tenía mayor solapamiento porque ambos publicaban resultados en SWE-bench Verified, Terminal-Bench 2.0 y OSWorld-Verified — aunque compartir el nombre del benchmark tampoco garantizaba entonces el mismo harness, número de intentos o herramientas disponibles, solo una vara más parecida que la de hoy. Ese solapamiento se redujo todavía más. El propio anuncio de GPT-5.3-Codex de OpenAI explica por qué empezó a preferir SWE-bench Pro sobre Verified: Pro cubre cuatro lenguajes en vez de solo Python y es más resistente a la contaminación de datos de entrenamiento. Ese cambio de vara de medir es la causa técnica real detrás del error que arrastraban ambos posts originales — uno lo resolvió mal (una sola columna "SWE-bench" con dos benchmarks distintos dentro), el otro lo resolvió mejor pero cometió una versión más sutil del mismo fallo: puso el SWE-bench Verified de Opus 4.6 y el SWE-bench Pro de GPT-5.3-Codex en la misma fila, como si fueran una sola prueba con dos nombres. El propio anuncio de GPT-5.3-Codex citado arriba confirma que no lo son: Verified y Pro miden cosas distintas (idiomas cubiertos, resistencia a contaminación) y sus resultados no son intercambiables entre sí.
Medio año después el problema se agravó: el anuncio de Claude Sonnet 5 (30 de junio de 2026) y el de Claude Opus 5 (24 de julio de 2026) ya ni siquiera abren con SWE-bench: Anthropic mide sus modelos actuales con Frontier-Bench v0.1, CursorBench 3.2, ARC-AGI-3 y OSWorld 2.0, con los números publicados en gráficos, no en texto verificable. El anuncio de disponibilidad general de GPT-5.6 (9 de julio de 2026) tampoco publicó cifra de SWE-bench Verified: usa SWE-bench Pro, Terminal-Bench 2.1, OSWorld 2.0 y BrowseComp. No hay overlap limpio salvo un benchmark.
Resultados publicados por cada proveedor (sin puente numérico entre ellos)
OSWorld 2.0 (control de aplicaciones de escritorio) es el único nombre de benchmark que OpenAI y Anthropic reportan hoy con fecha cercana. Pero compartir el nombre no crea una comparación: OpenAI mide a GPT-5.6 Sol contra su propio Opus 4.8, no contra Opus 5; Anthropic mide a Opus 5 contra su propio Fable 5, no contra GPT-5.6. No hay ninguna fila publicada por nadie que ponga a Sol y a Opus 5 uno frente al otro en la misma prueba. Y aunque la hubiera, compartir el nombre del benchmark no garantiza el mismo harness, el mismo número de intentos ni las mismas herramientas disponibles — eso es precisamente lo que hizo posible el error de fondo de esta fusión. Esto es lo que cada fabricante publica, tal cual, sin inventar una fila que cruce ambas columnas:
| Benchmark | Modelo | Resultado | Comparado por el fabricante contra | Fuente y fecha |
|---|---|---|---|---|
| OSWorld 2.0 | GPT-5.6 Sol | 62,6% | Opus 4.8 (no Opus 5) | OpenAI, 9 jul 2026 |
| OSWorld 2.0 | Claude Opus 5 | Sin cifra publicada en texto (solo en gráfico) | Fable 5 — modelo hermano de Anthropic vigente en paralelo, no su predecesor (10$/50$ por millón de tokens frente a los 5$/25$ de Opus 5) | Anthropic, 24 jul 2026 |
| Terminal-Bench 2.1 | GPT-5.6 Sol | 88,8% (Sol Ultra: 91,9%) | — (cifra absoluta, sin rival directo publicado en el anuncio) | OpenAI, 9 jul 2026 |
| SWE-bench Pro | GPT-5.6 Sol | 64,6% | — (cifra absoluta) | OpenAI, 9 jul 2026 |
| Frontier-Bench v0.1 (coding agéntico) | Claude Opus 5 | "Más del doble" que la referencia, sin cifra exacta en texto | Opus 4.8, su predecesor directo | Anthropic, 24 jul 2026 |
Ninguna fila de esta tabla se puede cruzar contra otra fila para decidir si Claude o Codex "gana": cada resultado está atado al modelo de referencia que eligió su propio fabricante, no al de la competencia. Cualquier tabla que compare "Claude 82%" contra "Codex 77%" que circule hoy está fabricando un puente numérico que ninguno de los dos anuncios oficiales respalda.
Coste real: cuánto pagas según cuánto usas
El precio en dólares por mes sí lo publica cada fabricante de forma verificable, sin depender de qué benchmark ganó esta semana. Lo que no es comparable entre filas es lo que ese precio compra: cada plan reparte un pool, un número de créditos o un límite de uso distinto, así que 20$ en una herramienta no da el mismo volumen de trabajo que 20$ en otra:
| Herramienta | Entrada | Uso medio-alto | Equipo (por asiento) |
|---|---|---|---|
| Claude Code | Pro, 20$/mes | Max 5x, 100$/mes | Team desde 20-25$/asiento; premium con Claude Code 100-125$/asiento |
| Cursor | Hobby, gratis | Pro, 20$/mes · Pro+, 60$/mes | Teams, 40$/asiento (premium 120$) |
| GitHub Copilot | Free, gratis | Pro, 10$/mes · Pro+, 39$/mes | Business/Enterprise, facturación por asiento con créditos de IA incluidos |
| OpenAI Codex (vía ChatGPT) | Plus, 20$/mes | Pro, 200$/mes — uso medido por créditos/tokens según la tarjeta de tarifas de Codex, no por un multiplicador fijo | Business, facturación por asiento (cifra exacta sujeta a contrato) |
Fuentes: precios de planes de Claude Code, precios de Cursor, planes de GitHub Copilot y la página oficial de uso de Codex según tu plan de ChatGPT. Tres matices que cambian el cálculo real:
- El precio del plan no es el precio del modelo. La tarifa de API de Anthropic muestra Claude Sonnet 5 a 2$/10$ por millón de tokens entrada/salida hasta el 31 de agosto de 2026, y luego 3$/15$; Opus 5 se mantiene en 5$/25$, igual que Opus 4.8. Si tu uso vía Claude Code agota el pool de tu plan, pagas estas tarifas de API por el excedente.
- Cursor y Copilot no cobran por "su" modelo, cobran por crédito consumido. Ambos ofrecen catálogos parcialmente solapados de modelos Claude, GPT y Gemini -sujetos al plan, la organización y el despliegue de cada momento- desde un pool de créditos equivalente al precio del plan; el modelo por defecto barato (Composer 2.5 en Cursor) existe justamente para no vaciar ese pool en tareas simples.
- OpenAI dejó de tener un solo precio de Codex. Su tarjeta de tarifas de Codex factura por familia dentro de GPT-5.6: Sol (la más cara, para tareas complejas), Terra (equilibrio) y Luna (la más barata), cada una con su propio consumo de créditos por tarea.
Por qué rinden distinto: arquitectura, no solo modelo
Parte de por qué estas cuatro herramientas no compiten realmente en la misma cancha es que resuelven problemas de entrega distintos, no solo tienen modelos distintos debajo:
- Claude Code es terminal-first. Vive en tu shell, no en una ventana aparte; está diseñado para sesiones largas sobre un repo completo, con subagentes y hooks para tareas que se dividen en pasos verificables. Encaja con quien ya piensa en comandos y pipelines.
- Cursor es IDE-first. Es un fork de VS Code con el agente integrado en el editor: el "Tab" de autocompletado y el modo Agente conviven en la misma ventana. Tiene sentido si tu unidad de trabajo es el archivo que tienes abierto, no el repo entero.
- GitHub Copilot es GitHub-native. Su modo agente no vive solo en el editor: puede recibir un Issue, trabajar en una rama y abrir un Pull Request sin que nadie abra un IDE. Es la opción que mejor encaja si tu proceso ya gira alrededor de Issues y PRs como unidad de trabajo.
- OpenAI Codex es cloud-async por diseño. Además del CLI local, su modo nube ejecuta tareas en un sandbox aislado que puedes lanzar y abandonar: el valor no está en la latencia de respuesta sino en poder encargar varias tareas en paralelo sin ocupar tu máquina.
Esta diferencia explica más del resultado percibido en el día a día que cualquier punto porcentual de benchmark: un modelo excelente en una arquitectura que no encaja con tu flujo se siente peor que un modelo mediocre bien integrado en el sitio donde ya trabajas.
Cuándo cambiar de herramienta
No hace falta re-evaluar las cuatro cada vez que sale un modelo nuevo. Las señales concretas de que toca cambiar son otras:
- Tu plan actual se queda corto en el pool de uso antes de fin de mes de forma sistemática (no una vez): es la señal de que el plan de entrada ya no es tu tier, no de que la herramienta esté mal elegida.
- Empezaste solo y ahora sois equipo: los pools compartidos de Cursor Teams o Copilot Business cambian el cálculo de coste por persona respecto al plan individual — vale la pena recalcular, no asumir que escala igual.
- El tipo de tarea cambió de forma estructural, no puntual: si pasaste de ediciones rápidas a refactors que tocan decenas de archivos, un agente IDE-first empieza a quedarse corto de contexto antes que uno terminal-first con ventana de 1M tokens.
- Tu fabricante actual deprecó el modelo que usabas sin sustituto directo en el mismo tier de precio: es el único caso donde de verdad conviene mirar de nuevo la tabla de benchmarks del momento — con la advertencia de que, si Anthropic y OpenAI siguen publicando en variantes distintas, esa tabla habrá que reconstruirla desde cero, no copiarla de un post de hace medio año.