← Volver al blog
Artículo 17 de agosto de 2026 · 5 min de lectura
OpenAI logra que su IA responda 14 veces más rápido

OpenAI logra que su IA responda 14 veces más rápido

OpenAI presentó Ultrafast: el mismo modelo GPT-5.6 Sol, con la misma inteligencia, corriendo hasta 14 veces más rápido gracias a un chip de Cerebras del tamaño de una oblea completa. Rompe una regla que parecía fija — más rápido ya no significa más tonto. Pero todavía no tiene precio ni fecha.

El 13 de agosto de 2026, OpenAI presentó Ultrafast: una vista previa limitada de un nuevo nivel de servicio en su API que hace correr a GPT-5.6 Sol hasta 14 veces más rápido que su versión estándar — hasta 750 tokens de salida por segundo (un token es cada fragmento de palabra que el modelo genera; 750 por segundo es, en la práctica, texto apareciendo más rápido de lo que cualquier persona puede leer). Lo notable no es solo la velocidad. Es que es exactamente el mismo modelo, con los mismos pesos (los parámetros internos que definen qué tan "inteligente" es), corriendo sobre hardware distinto — un chip de Cerebras del tamaño de una oblea de silicio completa, no una GPU tradicional.

Por qué esto rompe una regla que parecía fija

Hasta ahora, velocidad e inteligencia venían en una balanza: si querías un modelo rápido, elegías uno más chico y menos capaz; si querías el modelo más inteligente, aceptabas que fuera más lento. Ultrafast rompe esa relación — no es un modelo distinto optimizado para velocidad, es el mismo GPT-5.6 Sol de siempre, corriendo más rápido porque el chip que lo ejecuta está diseñado distinto.

El truco técnico está en cómo Cerebras resuelve el problema real detrás de la lentitud de una IA: mover datos de un lado a otro. En una GPU normal, el modelo tiene que ir a buscar sus propios parámetros a una memoria separada del chip cada vez que necesita usarlos — como si un cocinero tuviera que caminar hasta la despensa cada vez que necesita un ingrediente. El chip de Cerebras integra 44 GB de memoria directamente en el mismo silicio: los parámetros del modelo se quedan cargados ahí durante toda la ejecución, y los tokens fluyen sin interrupción entre las capas del modelo. El cocinero ya tiene todos los ingredientes sobre la mesa.

Para tareas donde el tiempo de espera importa —una conversación de voz en vivo, responder a una alerta de sistema en el momento exacto en que ocurre— esto cambia lo que es técnicamente posible, no solo lo que es cómodo.

Los números, comparados

Cerebras publicó comparaciones directas contra los otros dos niveles de velocidad que ya existían en el mercado — incluyendo, notablemente, contra los modelos de Anthropic (Claude), que analicé en un blog anterior sobre Opus 5 vs Fable 5:

ConfiguraciónVelocidad relativa
GPT-5.6 Sol Ultrafast (Cerebras)Referencia — hasta 750 tokens/segundo
GPT-5.6 Sol StandardHasta 14x más lento
Claude Fable 5~11x más lento que Ultrafast
Claude Opus 4.8, modo Fast~5x más lento que Ultrafast

Gemini_Generated_Image_s8qxj4s8qxj4s8qx

Un ejemplo concreto que dieron para hacerlo tangible: en el benchmark Humanity's Last Exam (2.500 preguntas de nivel experto), Ultrafast completó el examen en 11 horas y 11 minutos — donde otros modelos tardaron más de 78 horas en la misma prueba.

Como con cualquier estadística que una empresa publica sobre su propio producto comparándose con la competencia, vale tomarla con la cautela habitual: son las cifras de Cerebras y OpenAI sobre sí mismos, no una medición independiente.

El motivo de fondo: la apuesta de infraestructura ya está en marcha

Esto no aparece de la nada. Hace unos días escribí sobre la predicción de Jensen Huang (CEO de Nvidia) de que la industria de chips necesita crecer 10 veces en la próxima década para sostener el cómputo que exigen los agentes de IA. Ultrafast es, en la práctica, esa apuesta ya materializada en un producto: OpenAI y Cerebras firmaron en enero de 2026 un acuerdo multianual por más de 10.000 millones de dólares para desplegar hasta 750 megavatios de capacidad de inferencia de Cerebras hasta 2028. Ultrafast es la primera pieza visible de ese acuerdo llegando al público — aunque todavía en preview muy limitado.

Gemini_Generated_Image_9bfnn89bfnn89bfn

Lo que hay que tener claro: todavía no puedes usarlo

Acá está el matiz honesto que ningún titular menciona: Ultrafast está en vista previa limitada, disponible solo para un grupo selecto de clientes que están probando casos de uso en programación, investigación financiera, atención al cliente y aplicaciones de voz. No hay precio publicado ni fecha de disponibilidad general. OpenAI dice explícitamente que está usando este período para entender dónde un salto de velocidad de este tamaño genera más valor real, antes de abrir el acceso más ampliamente.

Para referencia, así es como se ubica frente a los otros niveles de servicio que sí puedes contratar hoy:

NivelVelocidadPrecio
StandardBasePrecio estándar de la API
Fast ModeHasta ~2.5x más rápidoAproximadamente el doble del precio estándar
UltrafastHasta 14x más rápidoSin precio público — preview cerrado

Qué significa esto para tu negocio, hoy

1. No planifiques ni presupuestes sobre algo que todavía no tiene precio. Es tentador imaginar casos de uso, pero hasta que OpenAI publique costos reales, cualquier cálculo de "cuánto me ahorraría" es especulación.

2. Si construyes (o piensas construir) algo donde la latencia es el problema central —un agente de voz en vivo, una respuesta automática a incidentes en tiempo real—, vale la pena registrar interés en el preview cuando esté disponible, porque este tipo de acceso anticipado suele ampliarse por oleadas, no de golpe.

3. Esto no cambia qué modelo te conviene, solo qué tan rápido corre. Si ya elegiste un modelo por su calidad o precio (como analicé con Opus 5 vs Fable 5), Ultrafast no vuelve obsoleta esa decisión — en algún momento simplemente puede hacer que ese mismo modelo responda más rápido, a un costo que todavía no se conoce.

---

Fuentes

  • openai
  • cerebras
  • gpt-5.6 sol
  • ia para negocios
  • infraestructura ia

¿Quieres automatizar esto en tu negocio?