Artículo
Los modelos de IA han bajado de precio: qué cambia eso en tu presupuesto (y qué no)
Durante julio de 2026 el precio de usar los modelos de inteligencia artificial se movió bastante, y hacia abajo. No es una promoción de verano: es la continuación de una tendencia que lleva años y que casi nadie traslada al empresario que hace unos meses recibió un presupuesto y lo guardó en un cajón.
Aquí tienes qué ha pasado exactamente, con fechas y cifras verificables, y algo que te van a contar menos: qué parte de un proyecto de IA se abarata cuando bajan los modelos y qué parte no baja ni un céntimo. Porque no son la misma cosa, y confundirlas lleva a presupuestar mal.
Qué ha pasado exactamente en julio de 2026
El movimiento más comentado vino de OpenAI. El 9 de julio de 2026 lanzó la familia GPT-5.6 en tres variantes —Sol para la gama alta, Terra para la gama media y Luna para el uso económico— y tres semanas después, el 30 de julio, anunció un recorte de precios sobre dos de ellas.
Los precios se publican por millón de tokens y siempre en dos columnas: lo que cuesta lo que le mandas al modelo (entrada) y lo que cuesta lo que te devuelve (salida). Así quedó la cosa:
| Modelo de OpenAI | Al lanzarse (9 jul) | Tras el recorte (30 jul) |
|---|---|---|
| GPT-5.6 Sol | 5,00 $ / 30,00 $ | Sin cambios |
| GPT-5.6 Terra | 2,50 $ / 15,00 $ | 2,00 $ / 12,00 $ (un 20% menos) |
| GPT-5.6 Luna | 1,00 $ / 6,00 $ | 0,20 $ / 1,20 $ (un 80% menos) |
Los precios van en dólares porque es como los publican los proveedores. No los convertimos a euros aquí: el tipo de cambio se mueve y una conversión de hoy sería un número falso dentro de un mes.
Anthropic: el mismo precio, más rendimiento
El caso de Claude Opus 5, lanzado el 24 de julio de 2026, es distinto y conviene entenderlo bien. Su precio es de 5 $ / 25 $ por millón de tokens. Su predecesor, Claude Opus 4.8, costaba exactamente lo mismo: 5 $ / 25 $.
Es decir: ahí no hubo bajada de precio, hubo más rendimiento al mismo precio. A efectos de lo que te importa, que es el coste de un trabajo terminado, viene a ser lo mismo: si el modelo acierta a la primera y necesita menos vueltas para dejarte el resultado bien, ese trabajo te ha salido más barato aunque la tarifa no se haya movido.
La tarifa por token es solo la mitad de la historia. La otra mitad es cuántos tokens hacen falta para terminar el trabajo.
La tendencia de fondo
Esto no empezó en julio. La firma de inversión a16z, en su análisis Welcome to LLMflation, sostiene que el coste por token a una calidad equivalente viene cayendo del orden de diez veces por año. Es una estimación suya, no un dato oficial, pero encaja con lo que se ve en las tarifas publicadas.
Qué estás pagando exactamente cuando pagas "por tokens"
Un token es el trozo de texto con el que trabaja el modelo por dentro. No es exactamente una palabra: es algo más pequeño. Una palabra corriente en castellano suele ocupar entre una y tres de esas piezas, y los signos de puntuación también cuentan. La idea que te sirve: se cobra por cantidad de texto que pasa por el modelo, no por pregunta ni por minuto.
Y se cobra en las dos direcciones. Lo que entra —la pregunta, más todo el contexto que la acompaña: el historial de la conversación, tu catálogo, tus horarios, el documento que le pasas— tiene un precio. Lo que sale —la respuesta— tiene otro, normalmente varias veces mayor. Por eso las tarifas se publican siempre como dos cifras separadas por una barra.
La consecuencia práctica es poco intuitiva: una conversación larga es cara sobre todo por la entrada, no por la respuesta. Cada vez que el cliente escribe un mensaje nuevo, el sistema vuelve a mandar toda la conversación anterior para que el modelo sepa de qué se está hablando. Un agente bien montado controla eso; uno montado a lo bruto, no.
Lo que baja, lo que no baja, y por qué importa la diferencia
Aquí está la parte que casi no se cuenta, y es la que decide si tu presupuesto cambia o se queda igual. En un proyecto de IA para una pyme, el precio del modelo casi nunca es lo que lo hace caro.
Piensa en un agente que atiende el teléfono de un taller. Lo que cuesta ahí es entender cómo trabaja ese taller, conectar el agente con la agenda que ya usan, decidir qué puede prometer y qué no, probarlo con llamadas reales y mantenerlo vivo cuando cambien los horarios o los precios. Los tokens de esas llamadas son la línea pequeña de la cuenta.
Baja: el consumo del modelo
La parte variable, la que crece cuando crece el uso. Es la que se ha movido este julio y la que seguirá moviéndose. Cuanto más volumen tengas, más te afecta la bajada.
No baja: entender tu negocio
Sentarse a ver cómo funciona tu proceso, qué casos raros hay y qué decisiones no puede tomar una máquina. Son horas de una persona y valen lo que valen.
No baja: la integración
Conectar con tu agenda, tu ERP, tu programa de gestión o tu centralita. Depende de lo que tengas montado, no de lo que cueste un modelo.
No baja: el mantenimiento
Un agente que atiende clientes no se deja solo. Cambian los precios, los horarios, la carta, el catálogo. Alguien tiene que revisarlo y corregir lo que salga mal.
No baja: la formación
Que tu equipo sepa usar lo que le has puesto delante. Es coste de personas y además es una obligación del reglamento europeo de IA desde febrero de 2025.
Que los modelos sean diez veces más baratos no hace que tu proyecto sea diez veces más barato. Hace que su parte variable pese menos.
Esto tiene una lectura optimista y una incómoda. La optimista: si lo que te frenaba era el coste recurrente —"¿y esto cuánto me va a costar cada mes?"— ese miedo tiene bastante menos fundamento en agosto de 2026 que hace un año. La incómoda: si lo que te frenaba era la puesta en marcha, esa cifra no se ha movido y no se va a mover, porque son horas de personas.
Cuál de las dos pesa más en tu caso depende del volumen. Un negocio que recibe cuatro llamadas al día tiene un consumo testimonial y todo el coste en la puesta en marcha; uno que atiende cientos de conversaciones a la semana nota la bajada de verdad. Separar esas dos partidas es lo primero que hacemos en una consultoría de IA, antes de recomendar nada.
La letra pequeña que conviene mirar antes de celebrar nada
Circula estos días una generalización fácil —"todo baja, cada vez es más barato"— y no es del todo cierta. El contraejemplo está publicado en la propia documentación de Google.
Gemini 3.7 Flash, lanzado el 13 de agosto de 2026, y Gemini 3.6 Flash están a 0,75 $ / 3,75 $ por millón de tokens. Pero es un precio introductorio: la página oficial de precios de Google indica que se duplica el 1 de enero de 2027, hasta 1,50 $ / 7,50 $. Para comparar, Gemini 3.5 Flash está a 1,50 $ / 9,00 $ y Gemini 3.5 Flash-Lite a 0,30 $ / 2,50 $.
No es ninguna trampa: está publicado y a la vista de cualquiera. Es simplemente el tipo de detalle que se le escapa a quien monta un proyecto sobre un modelo concreto y no vuelve a mirar la tarifa. Estas son las preguntas que conviene hacerle a quien te monte algo:
"¿Qué modelo usa esto y qué pasa si sube de precio?"
La respuesta buena es que el modelo se puede cambiar sin rehacer el proyecto. Si te dicen que habría que empezar de cero, estás atado.
"¿La tarifa que sostiene esta cuenta es introductoria?"
Pregúntalo explícitamente. Es información pública, está en la página del proveedor, y quien te lo monta debería conocerla.
"¿El consumo va a mi nombre o al vuestro?"
Cambia mucho la conversación. Si la cuenta del proveedor es tuya, la bajada te beneficia directamente. Si va incluida en una cuota cerrada, la bajada se la queda quien te la cobra.
"¿Qué me llevo si un día me voy?"
No tiene que ver con el precio, pero es el momento de preguntarlo. Un proyecto del que no te puedes llevar ni la configuración ni los datos es caro aunque salga barato.
Si descartaste un proyecto por el coste, la cuenta ya no es la misma
Esta es la conclusión accionable, y va dirigida a un caso muy concreto: pediste presupuesto en 2025, hiciste números, no salía y lo dejaste ahí. Es probable que aquella cuenta esté desactualizada por el lado del coste recurrente.
Rehacerla no requiere que llames a nadie. Son tres pasos:
Para la parte del ahorro tienes la calculadora de la guía de IA para pymes: pones las horas semanales que se come una tarea repetitiva y su coste por hora, y te dice lo que cuesta al año. No envía nada a ningún sitio, el cálculo se hace en tu navegador.
Y si lo que te frena es la inversión inicial y no el coste por uso, esa parte tiene otra vía: las ayudas públicas para implantar IA en una pyme cubren precisamente el pago único, que es justo lo que no baja solo.
Preguntas frecuentes
Si baja cada año, ¿no me conviene esperar a que baje más?
Si el proyecto ya te sale a cuenta hoy, esperar es renunciar al ahorro de los meses que esperes. Además, lo que baja es la parte variable, que suele ser la menor; la parte que no baja te va a costar igual dentro de un año. Esperar tiene sentido cuando el caso está justo en el límite, no cuando ya está claro.
¿Esto significa que mi proyecto será un 80% más barato?
No. Ese recorte es sobre la tarifa de un modelo concreto, no sobre un proyecto. En una pyme, el consumo del modelo suele pesar poco dentro del total comparado con la puesta en marcha, la integración y el mantenimiento, que no se han abaratado.
¿Por qué dais los precios en dólares y no en euros?
Porque es como los publican los proveedores. Convertirlos aquí sería darte una cifra que deja de ser cierta en cuanto se mueva el tipo de cambio, y preferimos no publicar números que caducan solos.
¿Me quedo atado al proveedor del modelo que elija ahora?
No deberías. Un proyecto bien planteado deja el modelo como una pieza intercambiable, de forma que cambiarlo sea una decisión de configuración y no rehacer el trabajo. Si te ofrecen algo donde eso no es posible, pregunta por qué antes de firmar.
¿Vosotros con qué modelo trabajáis?
Depende de lo que haya que hacer, y no es una evasiva comercial: para clasificar correo y para hablar con un cliente no conviene lo mismo. Esa elección se toma cuando se sabe qué hay que resolver y se explica con sus motivos, no como una marca cerrada de antemano.
¿Estos precios seguirán vigentes cuando lea esto?
Probablemente no todos. Por eso están fechados y por eso tienes los enlaces oficiales al final. Arriba aparece la fecha de última revisión del artículo: si has llegado meses después, comprueba los números en origen antes de usarlos.
Fuentes consultadas
- OpenAI — Advancing the price-performance frontier with GPT-5.6 · fuente oficial
- CNBC — OpenAI recorta el precio de sus modelos (30-07-2026) · consultado 26-08-2026
- Axios — OpenAI cuts prices for GPT-5.6 Terra and Luna (30-07-2026) · consultado 26-08-2026
- Anthropic — Precios de los modelos Claude · fuente oficial
- Google — Precios de la API de Gemini · fuente oficial
- a16z — Welcome to LLMflation · consultado 26-08-2026