La velocidad es el nuevo IQ: por qué las IAs ahora pelean por milisegundos
¿Por qué la velocidad se volvió prioridad en la carrera de la IA?
Porque la lentitud era el freno invisible: categorías enteras de uso, como la conversación por voz, la traducción simultánea y los agentes de muchos pasos, solo funcionan con respuestas casi instantáneas. Los anuncios recientes llegan a 750 tokens por segundo, hasta 14 veces más rápido que el ritmo normal.
Durante tres años, la carrera de la IA fue sobre inteligencia: qué modelo escribe mejor, razona más profundo, se equivoca menos. Esa carrera no terminó, pero apareció otra, y es sobre tiempo. OpenAI acaba de anunciar una capa de respuestas hasta 14 veces más rápidas, en torno a 750 tokens por segundo; las competidoras miden el éxito en milisegundos. Parece un detalle de ingeniería hasta que entiendes lo que desbloquea la velocidad: una IA que responde al instante no es solo más agradable. Cabe en lugares donde la lenta no cabía.
Traduciendo el anuncio para gente normal
"750 tokens por segundo" significa, en la práctica, la respuesta entera apareciendo antes de que termines de parpadear. Una página completa de texto en unos dos segundos. La diferencia entre ver a la IA "tipeando" y recibir la respuesta lista, como si ya la supiera.
¿Y por qué esto se volvió la obsesión de la industria ahora? Porque la lentitud era el freno invisible de la IA. Nos acostumbramos a esperar 10 o 20 segundos por una buena respuesta, pero acostumbrarse no es lo mismo que funcionar: hay categorías enteras de uso que mueren esperando.
Qué desbloquea la velocidad
- Conversación por voz de verdad. El diálogo humano tiene ritmo: más de un segundo de silencio y la conversación muere. Una IA de voz que tarda 5 segundos es un contestador; con respuestas en milisegundos, se vuelve interlocutor. Toda la atención telefónica con IA depende de esto.
- Traducción simultánea. Traducir el habla en tiempo real exige procesar y devolver casi junto con el hablante. Es la latencia, no la inteligencia, lo que separa el traductor de bolsillo de ciencia ficción de la función que ya llega a los teléfonos.
- Agentes que trabajan de verdad. Un agente ejecuta decenas de pasos encadenados: piensa, consulta, decide, repite. Si cada paso toma 10 segundos, una tarea de 30 pasos toma 5 minutos; con pasos de medio segundo, 15 segundos. La velocidad multiplica lo que cabe en una espera aceptable.
- IA invisible, incrustada en todo. Autocompletar, corregir, sugerir, clasificar en cada clic: funciones que solo existen si la respuesta llega antes de que notes que la pediste.

El intercambio escondido (que no cuentan en el anuncio)
La velocidad tiene precio, y no siempre es dinero. Buena parte de la ganancia viene de usar modelos más pequeños o versiones destiladas del grande, y un modelo más pequeño piensa menos profundo. La pregunta correcta no es "¿qué IA es más rápida?", sino "¿esta tarea necesita profundidad o agilidad?"
- Redactar el contrato, analizar la planilla compleja, revisar el texto importante: la paciencia compensa, llama al modelo profundo.
- Atender el teléfono, autocompletar, clasificar, resolver lo trivial: lo instantáneo gana, llama al rápido.
La analogía que ordena: el modelo profundo es el especialista al que consultas y esperas; el rápido es el empleado que resuelve en el momento. Las empresas maduras en IA no eligen uno; montan el mostrador con los dos y enrutan cada tarea al perfil correcto.
Qué cambia para ti
Como usuario: fíjate en el tiempo de respuesta de tus herramientas; explica para qué sirve cada una. Y desconfía del marketing: "tenemos el modelo más rápido" sin decir qué entrega es como vender el auto más veloz sin contar cuántos asientos tiene.
Como empresa: la latencia se volvió criterio de contrato. Si tu caso de uso es voz, atención o agentes de muchos pasos, pide al proveedor los números de tiempo de respuesta ANTES del precio por token. Un bot de voz con 4 segundos de retraso no es un bot peor; es un producto que no existe.
La inteligencia atrae titulares; la velocidad cambia hábitos. La IA que más vas a usar dentro de un año probablemente no es la que escribe el ensayo más bonito, sino la que responde antes de que notes que esperaste. En la historia de la tecnología, el ganador rara vez fue el más potente. Fue el que siempre estaba a mano.
Preguntas frecuentes
Porque la lentitud era el freno invisible: categorías enteras de uso, como la conversación por voz, la traducción simultánea y los agentes de muchos pasos, solo funcionan con respuestas casi instantáneas. Los anuncios recientes llegan a 750 tokens por segundo, hasta 14 veces más rápido que el ritmo normal.
Mide qué tan rápido la IA genera texto. A 750 tokens por segundo, una página completa sale en unos dos segundos: la respuesta aparece lista en vez de ir "tipeándose" en pantalla.
No. Parte de la velocidad viene de usar modelos más pequeños, que piensan menos profundo. Las tareas complejas piden el modelo profundo; las tareas de flujo (voz, triaje, autocompletar) piden el rápido. Las empresas maduras usan ambos y enrutan cada tarea.
Conversación por voz con ritmo humano (respuestas de menos de un segundo), traducción simultánea del habla, agentes que ejecutan decenas de pasos en segundos y funciones incrustadas que responden en cada clic.
Como criterio de contrato: para voz, atención y agentes, pide los números de tiempo de respuesta antes del precio. Un asistente de voz con 4 segundos de retraso no es peor: es inviable. La latencia define si el producto existe.

Ejecutivo de datos e IA con más de 20 años construyendo tecnología que mueve negocios. Microsoft Certified Trainer, con formación ejecutiva en MIT Sloan. Al frente de Data Lover, forma profesionales y lidera proyectos de IA en empresas.
Ver perfil y todos los artículos →


