Hace unas semanas, la salida de DeepSeek dio lugar a un debate sobre el modelo de las LLMs actuales. Y esta semana, con la salida de GPT-4.5 (ya os adelanto, bastante decepcionante aunque esperable para mi) creo que algo parecido va a pasar.
Hay dos tendencias de las que se va hablando y que vuelven a salir de forma cíclica:
- La necesidad de tarjetas gráficas es una burbuja que va a estallar en algún momento
- El modelo de entrenamiento de las LLMs actuales ha tocado techo
La IA y las tarjetas gráficas
Es bien sabido el boom que ha sufrido NVIDIA debido a que la IA Generativa se entrena sobre tarjetas gráficas de esta compañía.
Sin embargo, esto no es una novedad. Todos los que hemos trabajado con modelos de Deep Learning sabemos que cuando se utiliza PyTorch en modo CPU y GPU, la diferencia es abismal. La aceleración proporcionada por las tarjetas de NVIDIA no es exclusiva de la IA Generativa, sino de casi cualquier algoritmo de Machine Learning.
Lo que ha cambiado es que la IA Generativa ha logrado algo que ningún otro modelo había conseguido hasta ahora: acercar los servicios de IA al consumidor promedio para tareas cotidianas. Esto ha abierto un nuevo nicho de negocio en el que tanto grandes como pequeños actores quieren participar. Como resultado, se ha desatado una carrera por desarrollar “el mejor modelo”, lo que ha generado una necesidad de cómputo sin precedentes.
No nos equivoquemos: no solo hace falta potencia para entrenar un modelo, sino también para ejecutarlo. No se trata únicamente de la cantidad de memoria RAM disponible, sino de la velocidad con la que un modelo de lenguaje grande (LLM) puede procesar información. Un buen ejemplo es el servicio Ollama, que permite descargar modelos de IA y ejecutarlos localmente; dependiendo del equipo que se utilice, se puede notar claramente la diferencia en rendimiento.
Actualmente, el uso de tarjetas gráficas está focalizado en el entrenamiento de modelos. Se han anunciado y construido numerosos centros de datos dedicados a esta tarea. Sin embargo, una vez que un modelo está entrenado, también es necesario ejecutarlo. A simple vista, se podría pensar que una vez se desarrollen modelos suficientemente avanzados, la demanda de cómputo disminuirá. Pero la realidad es que la IA se está integrando cada vez más en nuestro día a día, en herramientas como los Copilots de Office, entornos de desarrollo como Cursor, y programas de diseño como Adobe PDF y Figma.
En otras palabras, la necesidad de utilizar algoritmos de IA Generativa no solo se mantendrá, sino que crecerá con el tiempo. Aunque la demanda de entrenamiento podría disminuir a medida que la curva del hype de la IA Generativa se estabilice, su uso continuará expandiéndose en los próximos años.
Para mí, lo que OpenAI inició no fue simplemente la creación de un modelo de conversación avanzado, sino el comienzo de una revolución en el uso masivo de la Inteligencia Artificial. Y esto requerirá potencia de cómputo, y a día de hoy, el hardware más óptimo para esto a gran escala son las tarjetas gráficas.
El ciclo de entrenamiento de un modelo
Voy a empezar por mi conclusion final: estoy de acuerdo, el modelo de escalado de las LLMs que resumo en “más grande, mejor” no tiene un buen futuro. De la misma manera que no lo ha tenido nunca. Los ejemplos son amplios:
- Intenta entrenar una red neuronal con 1 sola capa interna para hacer algo “similar” a lo que hace una LLM , o mejor aún aunque solo sea , en labores de traducción. Dale los millones y millones de neuronas que quieras, no lo conseguirás. Fueron necesarios avances en arquitecturas Deep (Deep Learning) para ver saltos sustanciales en este ámbito.
- O intenta hacer algo parecido con una LSTM, todo lo grande que quieras, (un tipo de red neuronal, predecesora de los Transformers en los que se basan las LLM actuales), tampoco.
- O intenta hacer un algoritmo de clasificación avanzado usando k-means con una tasa de acierto del 100%. Dale todas las iteraciones que quieras a su entrenamiento, no podrás.
Ejemplo de mejora en procesamiento de imagenes con CNN
El procesamiento de imagenes había sido históricamente un caso de uso complejo de manejar por los modelos tradicionales de redes neuronales. Anualmente existía una competición donde cualquiera podía desarrollar un modelo y «competir» por el mejor resultado, basado en el set de imagenes ImageNet

En este ejemplo puede verse cómo el índice de error en la competición ImageNet Classification ha ido bajando con los años. Antes de 2013 se trabajaba con redes neuronales básicas, y en 2013 aparece la primera red neuronal profunda, haciendo que el error caiga drásticamente. A partir de ahí, se han desarrollado nuevas arquitecturas de CNN (redes neuronales convolucionales usadas en procesamiento de imágenes). Algunas conclusiones clave:
- La mejora del error en 5 años es enorme: de un 25.8% a un 3.6%.
- Las mejoras más sustanciales se dan en los primeros años. Luego, las mejoras son menos drásticas.
- A partir de 2015, el número de capas (complejidad del modelo) también aumenta drásticamente.
Con las LLMs pasa lo mismo. Los benchmarks utilizados durante este tiempo, útiles para comparar modelos de LLM en tareas como Q&A y resolución de problemas matemáticos, empiezan a quedarse cortos. Un buen ejemplo es la salida de Claude 3.7, donde muchos test están rozando el 100% en casi todos los casos.
Con las LLMs pasa lo mismo. Los benchmarks utilizados durante este tiempo, los cuales eran muy útiles para comparar modelos de LLM “tradicionales” como Q&A, Math problem-solving, etc, con los modelos “razonadores” empiézan a quedarse cortos. Mirar la siguiente figura, que he extraído de X, con la salida de Claude 3.7 Fijaros como hay muchos test que están rozando el 100% en casi todos los casos

El ciclo de madurez de los modelos de IA
Todas las técnicas de aprendizaje utilizadas hasta la fecha tienen un techo. Esta historia se repite cíclicamente:
- Inicio:
- Aparece una nueva técnica o modelo.
- Las mejoras en los resultados son contundentes, estableciendo un nuevo estado del arte.
- Desarrollo:
- El modelo inicial tiene múltiples vías de mejora en resultados o rendimiento.
- Se vive una época de mejora constante hasta que se va convergiendo al potencial final del modelo.
- Maduración:
- Se continúa optimizando el modelo, mejorando el rendimiento o generando variantes con mejoras en áreas específicas.
- Sin embargo, las mejoras se vuelven más marginales y el modelo muestra signos de “agotamiento”.
¿Es esto malo? No. Es el ciclo del desarrollo algorítmico y es completamente normal.
¿Dónde estamos hoy con las LLMs?
Si hablamos de una LLM estándar, es decir, una red basada en transformers con un entrenamiento convencional, estamos en la fase de maduración. Por eso se dice que el modelo muestra síntomas de agotamiento. La técnica iniciada por OpenAI está cerca de su límite. Un buen ejemplo es GPT-4.5, que salió hace unos días. ¿Es un buen modelo? Sí. ¿Tiene una mejora significativa más allá de una respuesta más fluida y natural? Para mí, no. Y probablemente sea el último modelo de esta índole, donde simplemente se escala el tamaño del modelo y su entrenamiento.
Entonces ¿ ya está? ¿La famosa IA ha tocado techo? Rotundamente NO.
Hace un tiempo OpenAI habló de los 5 niveles de evolución de la IA para llegar a la AGI (y pongo AGI con mucho cuidado porque me parece la nueva palabra de moda.. pero esto es tema para otro post)
- Nivel 1 IA Conversacional : Chatbots como venimos conociendo ahora
- Nivel 2 IA Razonadora: modelos con capacidad de razonamiento
- Nivel 3 IA Autónoma: agentes autónomos
- Nivel 4 IA Innovadora: capaces de generar innovaciones no especificadas inicialmente por los usuarios.
- Nivel 5 IA Coporativa /Organizaciones: IAs capaces de hacer el trabajo entero de organizaciones
Mi opinión personal del punto en el que estamos actualmente:

- Nivel 1: estas son las LLMs que todos conocemos. ¿Qué falta? Rendimiento principalmente. El coste actual de entrenamiento e inferencia es muy alto para un uso masivo. También quedan mejoras puntuales en naturalidad de respuesta, alucinaciones y otros aspectos de «fine-tunning»
- Nivel 2: El año pasado OpenAI anunció sus modelos razonadores ( ya hablaremos en profundidad de esto) Este nuevo tipo de modelo fue seguido por todos posteriormente pero todavía es una tecnología en proceso de desarrollo
- Nivel 3: Tal vez debería estar más bajo pero dotar de autonomía es algo que se ha añadido a las LLms desde sus inicios para poder interactuar con su entorno (tools). Cuando su capacidad de razonamiento era más limitada se desarrollaron técnicas de agentes, como ReAct, Chain of Thoughts, etc para mejorarlo, por lo que es un área que lleva en evolución desde los inicios y tiene de bueno de aprovechar todas la ventajas de los Niveles 1 y 2 de forma directa
- Nivel 4: aquí creo que a día de hoy hay muy poco o nada hecho
- Nivel 5: lo pongo algo por encima que el Nivel 4, porque con arquitecturas multi-agentes se está intentando conseguir algo en esta línea, agentes con objetivos específicos interactuando entre ellos para obtener un objetivo global
En el Nivel 2 hemos visto la necesidad de nuevas técnicas para dotar de razonamiento a las LLMs. Los modelos razonadores han pulverizado los benchmark habituales en tareas como matemáticas, programación, etc. Seguramente para el resto de niveles pueda necesitarse nuevas técnicas.
Por tanto, ¿estamos tocando techo? Para mi en el Nivel 1 SI. En el resto de niveles estamos empezando, queda mucho camino por recorrer.
¿La necesidad de potencia de cómputo va a caer? Desde mi perspectiva NO, solamente se va a transformar , en el nivel 1 de entrenamiento a uso, y va a evolucionar hacia los nuevos modelos necesarios para el resto de niveles.
Evolución y transformación, no disminución

