El 13 de agosto de 2026, OpenAI presentó Ultrafast: una vista previa limitada de un nuevo nivel de servicio en su API que hace correr a GPT-5.6 Sol hasta 14 veces más rápido que su versión estándar — hasta 750 tokens de salida por segundo (un token es cada fragmento de palabra que el modelo genera; 750 por segundo es, en la práctica, texto apareciendo más rápido de lo que cualquier persona puede leer). Lo notable no es solo la velocidad. Es que es exactamente el mismo modelo, con los mismos pesos (los parámetros internos que definen qué tan "inteligente" es), corriendo sobre hardware distinto — un chip de Cerebras del tamaño de una oblea de silicio completa, no una GPU tradicional.
Por qué esto rompe una regla que parecía fija
Hasta ahora, velocidad e inteligencia venían en una balanza: si querías un modelo rápido, elegías uno más chico y menos capaz; si querías el modelo más inteligente, aceptabas que fuera más lento. Ultrafast rompe esa relación — no es un modelo distinto optimizado para velocidad, es el mismo GPT-5.6 Sol de siempre, corriendo más rápido porque el chip que lo ejecuta está diseñado distinto.
El truco técnico está en cómo Cerebras resuelve el problema real detrás de la lentitud de una IA: mover datos de un lado a otro. En una GPU normal, el modelo tiene que ir a buscar sus propios parámetros a una memoria separada del chip cada vez que necesita usarlos — como si un cocinero tuviera que caminar hasta la despensa cada vez que necesita un ingrediente. El chip de Cerebras integra 44 GB de memoria directamente en el mismo silicio: los parámetros del modelo se quedan cargados ahí durante toda la ejecución, y los tokens fluyen sin interrupción entre las capas del modelo. El cocinero ya tiene todos los ingredientes sobre la mesa.
Para tareas donde el tiempo de espera importa —una conversación de voz en vivo, responder a una alerta de sistema en el momento exacto en que ocurre— esto cambia lo que es técnicamente posible, no solo lo que es cómodo.
Los números, comparados
Cerebras publicó comparaciones directas contra los otros dos niveles de velocidad que ya existían en el mercado — incluyendo, notablemente, contra los modelos de Anthropic (Claude), que analicé en un blog anterior sobre Opus 5 vs Fable 5:
| Configuración | Velocidad relativa |
|---|---|
| GPT-5.6 Sol Ultrafast (Cerebras) | Referencia — hasta 750 tokens/segundo |
| GPT-5.6 Sol Standard | Hasta 14x más lento |
| Claude Fable 5 | ~11x más lento que Ultrafast |
| Claude Opus 4.8, modo Fast | ~5x más lento que Ultrafast |

Un ejemplo concreto que dieron para hacerlo tangible: en el benchmark Humanity's Last Exam (2.500 preguntas de nivel experto), Ultrafast completó el examen en 11 horas y 11 minutos — donde otros modelos tardaron más de 78 horas en la misma prueba.
Como con cualquier estadística que una empresa publica sobre su propio producto comparándose con la competencia, vale tomarla con la cautela habitual: son las cifras de Cerebras y OpenAI sobre sí mismos, no una medición independiente.
El motivo de fondo: la apuesta de infraestructura ya está en marcha
Esto no aparece de la nada. Hace unos días escribí sobre la predicción de Jensen Huang (CEO de Nvidia) de que la industria de chips necesita crecer 10 veces en la próxima década para sostener el cómputo que exigen los agentes de IA. Ultrafast es, en la práctica, esa apuesta ya materializada en un producto: OpenAI y Cerebras firmaron en enero de 2026 un acuerdo multianual por más de 10.000 millones de dólares para desplegar hasta 750 megavatios de capacidad de inferencia de Cerebras hasta 2028. Ultrafast es la primera pieza visible de ese acuerdo llegando al público — aunque todavía en preview muy limitado.

Lo que hay que tener claro: todavía no puedes usarlo
Acá está el matiz honesto que ningún titular menciona: Ultrafast está en vista previa limitada, disponible solo para un grupo selecto de clientes que están probando casos de uso en programación, investigación financiera, atención al cliente y aplicaciones de voz. No hay precio publicado ni fecha de disponibilidad general. OpenAI dice explícitamente que está usando este período para entender dónde un salto de velocidad de este tamaño genera más valor real, antes de abrir el acceso más ampliamente.
Para referencia, así es como se ubica frente a los otros niveles de servicio que sí puedes contratar hoy:
| Nivel | Velocidad | Precio |
|---|---|---|
| Standard | Base | Precio estándar de la API |
| Fast Mode | Hasta ~2.5x más rápido | Aproximadamente el doble del precio estándar |
| Ultrafast | Hasta 14x más rápido | Sin precio público — preview cerrado |
Qué significa esto para tu negocio, hoy
1. No planifiques ni presupuestes sobre algo que todavía no tiene precio. Es tentador imaginar casos de uso, pero hasta que OpenAI publique costos reales, cualquier cálculo de "cuánto me ahorraría" es especulación.
2. Si construyes (o piensas construir) algo donde la latencia es el problema central —un agente de voz en vivo, una respuesta automática a incidentes en tiempo real—, vale la pena registrar interés en el preview cuando esté disponible, porque este tipo de acceso anticipado suele ampliarse por oleadas, no de golpe.
3. Esto no cambia qué modelo te conviene, solo qué tan rápido corre. Si ya elegiste un modelo por su calidad o precio (como analicé con Opus 5 vs Fable 5), Ultrafast no vuelve obsoleta esa decisión — en algún momento simplemente puede hacer que ese mismo modelo responda más rápido, a un costo que todavía no se conoce.
---
Fuentes
- Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed — OpenAI
- Accelerating GPT-5.6 Sol Ultrafast with OpenAI — Cerebras
- Cerebras Powers Ultrafast Mode for OpenAI's GPT-5.6 Sol — Cerebras (comunicado de resultados)
- GPT-5.6 Sol goes 14x faster as OpenAI launches Ultrafast mode powered by Cerebras — The Decoder
- OpenAI previews Cerebras-powered GPT-5.6 Sol tier at up to 750 tokens per second — MLQ News
- GPT-5.6 Sol Now Runs at Real-Time Speed: OpenAI's Ultrafast Preview Offers No Price or Date — Tech Times
