Cada vez que le pides algo a tu chatbot favorito, tu consulta puede viajar miles de kilómetros hasta algún centro de datos, donde es procesada por un LLM que se ejecuta en máquinas que consumen electricidad a espuertas, todo ello para lograr que la respuesta se muestre en tu pantalla en cuestión de segundos. Todo muy fluido, pero ese modelo de “todo en la nube” tiene un problema que se hace cada vez más evidente: la demanda de consultas de IA crece a un ritmo más rápido que al que pueden ampliarse los centros de datos.
Por ello, recientemente un grupo de investigadores de Stanford y de la empresa Together AI decidió estudiar si de verdad hace falta esa dependencia de la nube para mantener nuestros recientemente adquiridos flujos de trabajo, o si una parte importante de nuestras consultas podría resolverse en el propio ordenador del usuario.
Y para responder a esa duda, midieron más de un millón de consultas reales ejecutadas sobre veinte modelos de IA y ocho tipos de hardware distintos. Su conclusión: gran parte de lo que hoy le pedimos a la IA ya podría procesarse localmente, en dispositivos tan comunes como un portátil de gama alta.
Y, de paso, la investigación ha servido para que estos científicos nos propongan una nueva forma de medir cuánto hemos avanzado hacia ese escenario.
Un déjà vu tecnológico: de los mainframes al escritorio
Demos un pequeño salto atrás en el tiempo: entre 1946 y 2009, la eficiencia energética de los ordenadores (el rendimiento obtenido por cada vatio consumido) se había venido duplicando aproximadamente cada año y medio. Ese progreso fue lo que permitió que tareas antes reservadas a enormes mainframes empresariales pasaran a ejecutarse en ordenadores personales.
Pues bien, los autores del estudio plantean que la inteligencia artificial podría estar viviendo un proceso parecido, favorecido por tres avances que han coincidido en el tiempo.
Primero, han aparecido modelos de lenguaje “pequeños” (de 20.000 millones de parámetros activos o menos, frente a los cientos de miles de millones de los modelos de vanguardia como GPT-5 o Gemini 2.5 Pro) que rinden bien en muchas tareas cotidianas aun ejecutándose localmente: Qwen3, Llama 3.1 o la familia gpt-oss de OpenAI son ejemplos de esta generación.
Segundo, el hardware doméstico ha dado un salto notable: chips como el Apple M4 Max cuentan con más de 100 GB de memoria unificada, suficiente para alojar estos modelos y ejecutarlos con una latencia razonable.
Tercero, ha surgido un ecosistema de asistentes de IA pensados para funcionar directamente en el dispositivo del usuario, sin depender de un servidor remoto.
Comparando el mejor modelo local disponible en cada año, junto con el mejor chip de la época, los investigadores encontraron que la inteligencia por vatio ha mejorado 5,3 veces entre 2023 y 2025.
La métrica que faltaba: inteligencia por vatio
Pero evaluar de forma objetiva si esta transición era o no real, y no solo una promesa comercial, exigía una forma de medirla. No basta con mirar cuánta energía consume un modelo (una IA puede ser eficiente pero inútil) ni con mirar solo su precisión (teóricamente, podría darte respuestas de genio, pero a cambio de consumir ella misma igual cantidad de electricidad que una gran ciudad).
De modo que hacía falta medir y tener en cuenta ambos factores a la vez. Si lo piensas, es una lógica similar a medir un coche no por su velocidad máxima, sino por los kilómetros que recorre con un litro de combustible.
De ahí surge el concepto central del estudio: la inteligencia por vatio (IPW, por sus siglas en inglés). Se calcula dividiendo la precisión con la que un modelo resuelve una tarea entre la cantidad de energía, en vatios, que necesita para hacerlo. Cuantas más respuestas correctas se obtienen por cada unidad de electricidad consumida, mayor es la inteligencia por vatio.
Los investigadores definieron también una métrica complementaria, la inteligencia por julio, que en lugar de fijarse en la potencia instantánea mide el consumo energético total de la respuesta, de principio a fin. Y donde la primera es relevante para dispositivos con límites de temperatura (como un portátil), la segunda, para el presupuesto energético global de una empresa o un país.
Estos dos centros de datos de Aragón necesitarán casi un tercio de la electricidad que gastó la región en 2025
Aragón se ha convertido en poco más de dos años en uno de los grandes destinos europeos para la instalación de centros de datos. Empresas tecnológicas y fondos de inversión han anunciado ya más de veinte proyectos en la comunidad, atraídos por la abundancia de energía renovable y de suelo disponible, así como por la posibilidad de reducir los plazos bur…
El experimento: un millón de preguntas, veinte modelos, ocho chips
Para poner a prueba esta idea, el equipo reunió más de un millón de consultas reales de usuarios —conversaciones cotidianas, preguntas de razonamiento, exámenes de conocimiento general y de nivel de posgrado— y las procesó con más de veinte modelos de lenguaje locales, desde los más recientes (Qwen3, gpt-oss, Gemma 3, Granite 4 de IBM) hasta modelos de hace un par de años (Mixtral-8x7B, Llama 3.1), ejecutados sobre ocho aceleradores de hardware distintos: chips de consumo, como los de Apple y AMD, y GPU de nivel empresarial, como las de NVIDIA en centros de datos.
Para cada consulta midieron cuatro variables: si la respuesta era correcta (comparándola con la de un modelo de frontera como Gemini 2.5 Pro), cuánta energía consumió, cuánto tardó en generarse y cuánta potencia eléctrica exigió el proceso. Con esos datos calcularon la inteligencia por vatio de cada combinación de modelo y chip, y compararon su evolución entre 2023 y 2025.
La IA local ya resuelve la mayoría de las preguntas cotidianas
El resultado central es este: combinando el mejor modelo local disponible para cada tipo de pregunta, se logra responder correctamente al 88,7% de las consultas de chat y razonamiento estudiadas. Casi nueve de cada diez preguntas habituales a un asistente de IA podrían, en principio, resolverse sin salir del propio dispositivo.
El porcentaje varía según el tipo de tarea, claro. En conversaciones cotidianas (peticiones de consejos prácticos, búsquedas de información, labores de asistencia a la escritura) que según estudios previos representan alrededor del 77% de las consultas reales a chatbots, los modelos locales alcanzan una cobertura del 88,9%.
En tareas de razonamiento más exigente, la cifra baja al 64,9%, y en dominios técnicos muy especializados, como arquitectura, ingeniería o ciencias físicas, los modelos pequeños siguen quedándose por detrás de los modelos de la nube.
Pero, los investigadores probaron también qué pasaría si, para cada pregunta, se pudiera elegir de antemano cuál de los más de veinte modelos locales es el que mejor la responde, en lugar de usar siempre el mismo. Ese reparto ideal de ‘cada pregunta con su modelo más adecuado’ (y nada impide tener docenas de modelos de IA instalados en un portátil) llega a superar incluso a los esos modelos líderes en las pruebas de razonamiento más difíciles. Hurra por el trabajo colectivo.
La clave está en repartir el trabajo entre la ‘nube’ y el hardware local
El estudio confirma también algo que era de esperar: el hardware de centro de datos, diseñado específicamente para IA, sigue siendo más eficiente que los chips de consumo cuando ejecuta exactamente el mismo modelo. Ahora bien, que cada consulta individual se resuelva de forma menos eficiente en un chip local no significa que procesarlo todo en la nube sea la opción más eficiente a nivel de sistema.
Los investigadores simularon un sistema híbrido que reparte las consultas entre modelos pequeños locales y un modelo grande en la nube, con un volumen de tráfico realista de más de 80 millones de consultas en 24 horas. La lógica: las preguntas cotidianas se resuelven en el dispositivo del usuario, y solo las más difíciles —un 19,3% del total, las que los modelos pequeños no logran responder bien— se envían al modelo grande.
Un reparto perfecto de las consultas —que supiera de antemano qué modelo usar en cada caso— reduciría el consumo energético en un 80,4%, el cómputo necesario en un 77,3% y el coste económico en un 73,8%, frente a enviarlo todo al modelo más grande.
¿En qué se traduce todo esto?
Estos hallazgos tienen consecuencias concretas mucho más allá de lo teórico:
Privacidad. Si buena parte de las consultas cotidianas (resumir un texto, redactar un correo, resolver una duda general) se procesan en el propio dispositivo, esa información nunca necesita salir de él. Adiós a las sospechas de reutilización o vigilancia de nuestros datos personales.
Coste y consumo energético. El gasto eléctrico de los centros de datos de IA preocupa ya en varios países, y la construcción de nuevas infraestructuras no avanza al ritmo de la demanda. Desviar una fracción del tráfico hacia dispositivos locales aliviaría esa presión sin necesidad de aumentar la capacidad eléctrica.
Funcionamiento sin conexión. Un asistente capaz de resolver la mayoría de las preguntas cotidianas sin depender de Internet permite usos en zonas con mala conectividad y hace la experiencia menos vulnerable a caídas del servicio en la nube.
Acceso más amplio. No hace falta una gran empresa con clústeres de GPU para tener un asistente competente; un portátil de gama alta ya cubre buena parte de las necesidades habituales.




