Artículo · Metodología
¿Cuánta energía consume una recomendación de películas con IA?
Por qué una arquitectura de datos inteligente supera al cómputo bruto: el cálculo completo detrás de las cifras de eficiencia de MovieMind, medido con peticiones reales.
Resumen
Una predicción de rating en MovieMind es una consulta de base de datos y consume menos de 0.001 Wh. Hacer la misma pregunta a un chatbot grande cuesta más de 1000 veces más según cifras de los proveedores. Replicar un mes completo de MovieMind con un chatbot consumiría al menos 20 veces más energía, y de 80 a 350 veces más con igual información. La razón no es magia sino arquitectura: calculamos el conocimiento sobre películas y gustos exactamente una vez y lo compartimos entre todos los usuarios, mientras que un chatbot debe derivarlo de nuevo en cada petición. Las recomendaciones no empeoran en el proceso. Se vuelven más personales.
La tesis: la inteligencia pertenece a los datos, no a cada petición
Los grandes modelos de lenguaje responden cada pregunta activando todo su conocimiento del mundo en tiempo de ejecución. Es impresionante, pero derrochador cuando la misma tarea se repite miles de veces. Una recomendación de películas no necesita conocimiento del mundo en cada llamada. Necesita una comprensión precisa y reutilizable de las películas y de tu gusto.
MovieMind coloca esa comprensión en la canalización de datos. Cada película se incrusta como vector exactamente una vez, con su descripción, géneros, dirección y palabras clave, y ese conocimiento se comparte entre todos los usuarios. Tu gusto vive al lado, como estructura sobre tus propias valoraciones. Una predicción se convierte entonces en una búsqueda de vecindad en ese espacio, y una búsqueda por lenguaje en un pequeño paso lingüístico sobre candidatos prefiltrados. La estructura de datos sustituye al cómputo. De ahí salen exactamente los factores medidos de este artículo.
El usuario de ejemplo
Alex ha valorado 120 películas y usa MovieMind durante un mes típico: 20 búsquedas en lenguaje natural, 1 resumen de perfil y 250 predicciones de rating. Las predicciones no son un detalle menor: cada búsqueda vibe muestra una predicción personal para cada uno de sus 6 resultados, es decir 120 al mes solo por las búsquedas, más unas 4 al día navegando por listas y fichas. Todos los valores de MovieMind de este artículo se midieron el 2026-07-28 con peticiones reales a la API (modelo: gemini-3.1-flash-lite (thinking: low)), no son estimaciones.
Las mediciones
Consumo de tokens de peticiones reales idénticas a producción:
- Búsqueda vibe (MovieMind)
- 1042 entrada + 725 salida + 128 razonamiento = 1895 tokens
- Resumen de perfil (MovieMind)
- 509 tokens
- Predicción de rating (MovieMind)
- 0 tokens de LLM, una consulta pgvector, menos de 0.001 Wh
- Equivalente chatbot de una predicción (solo títulos + valoraciones)
- 2667 tokens de entrada para la lista pegada (verificado con countTokens), unos 3300 tokens en total
- Equivalente chatbot con igual información
- 11.425 tokens de entrada para 120 títulos con descripción, géneros, dirección y tagline (medido con countTokens, unos 95 tokens por título), unos 12.100 tokens en total
Medición 1: la búsqueda por lenguaje, de 2 a 10 veces más eficiente
Donde hay que entender lenguaje, MovieMind también usa un modelo, pero el más pequeño capaz y con razonamiento limitado: 1895 tokens medidos por búsqueda, de ellos solo 128 de razonamiento. La inteligencia de recomendación no está en el modelo sino en la búsqueda vectorial previa, que filtra miles de títulos a 18 candidatos antes de que el modelo actúe. Un chatbot grande necesitaría tu historial en contexto para la misma tarea, unos 3.900 tokens o aproximadamente 1,3 Wh. Según la suposición de modelo, resulta un factor de 2 (conservador) a 10 (realista).
La ventaja no es estática: crece con cada película que valoras. Imagina mantener tus valoraciones en una hoja de cálculo y pegarlas en ChatGPT con cada búsqueda. Esa lista crece con cada noche de cine. El coste de búsqueda de MovieMind permanece constante en 1895 tokens porque la inteligencia de recomendación reside en embeddings precalculados y la búsqueda pgvector, no en el prompt del LLM. El modelo de lenguaje solo selecciona entre 18 candidatos prefiltrados y redacta la justificación.
| Películas valoradas | Tokens chatbot | Tokens MovieMind | Factor energético |
|---|---|---|---|
| 120 | 3900 | 1895 | 2–10× |
| 500 | 12.260 | 1895 | 6–32× |
| 1000 | 23.260 | 1895 | 12–61× |
| 1800 | 40.860 | 1895 | 22–108× |
La fórmula es transparente: contexto del chatbot = 1260 tokens de overhead (prompt del sistema, consulta, salida, razonamiento) + 22 tokens por título valorado. MovieMind se mantiene en 1895 tokens independientemente del tamaño de la colección. El extremo conservador cuenta Flash-Lite a la misma tasa energética que un modelo grande; el extremo realista a una quinta parte.
Medición 2: la predicción de rating, más de 1000 veces más eficiente
MovieMind responde cuánto te gustaría una película sin ningún modelo de lenguaje: como media ponderada por similitud de los títulos más parecidos que ya has valorado. Es una consulta de base de datos con cota superior de 0.001 Wh. Un chatbot no tiene memoria de tu historia cinéfila, así que debe ir en el prompt en cada petición. El suelo es una simple lista de títulos y valoraciones: 2667 tokens medidos para 120 títulos, unos 3300 tokens en total, aproximadamente 1,1 Wh, factor superior a 1000. Ese suelo es deliberadamente favorable al chatbot, porque asume que el modelo conoce con fiabilidad cada título por su entrenamiento. Cierto para los blockbusters, no fiable para títulos de nicho, estrenos posteriores al corte de entrenamiento o nombres ambiguos. Para la misma base de información con la que calcula MovieMind (descripción, géneros, dirección y tagline de cada título valorado), reconstruimos el prompt con 120 títulos reales y lo medimos: 11.425 tokens de entrada, unos 12.100 en total, unos 4.1 Wh, factor de aproximadamente 4000. La distancia crece con la colección: con 500 títulos valorados son unos 48.200 tokens, unos 16 Wh, factor de aproximadamente 16.000. La consulta de MovieMind permanece constante sin importar el tamaño de la colección.
Medición 3: un mes completo, al menos 20 veces, realistamente hasta 350 veces más eficiente
El mes de Alex en MovieMind: 20 búsquedas y 1 resumen suman unos 38.000 tokens de LLM, más 250 predicciones como consultas de base de datos que juntas cuestan menos de 0,3 Wh. Total: entre 3 y 13 Wh. La misma utilidad vía chatbot ya cuesta unos 900.000 tokens o 300 Wh en la variante favorable de solo títulos. Con igual información, es decir con descripciones en cada petición, son aproximadamente 3,3 millones de tokens o unos 1100 Wh, factor de 80 a 350. La razón estructural es la misma: MovieMind calcula el embedding de una película exactamente una vez y lo comparte entre todos los usuarios; un chatbot vuelve a derivar tu gusto en cada sesión.
Por qué la calidad sube en lugar de bajar
La eficiencia suena a compromiso. Aquí es lo contrario. Un chatbot solo conoce tu gusto si le entregas tu lista completa de valoraciones en cada pregunta, e incluso entonces debe derivarlo de nuevo de una lista de texto. MovieMind calcula de forma permanente con tu historial completo de valoraciones en el mismo espacio vectorial donde viven las películas. Cada nueva valoración afina la imagen sin que haya que explicar nada de nuevo. Una recomendación no es, por tanto, la opinión de un modelo, sino una derivación trazable de tus propios juicios.
Supuestos y conversión
- Conversión: 0,34 Wh por consulta media de chatbot (OpenAI) con ~1.000 tokens procesados, energía proporcional al número de tokens.
- Variante conservadora: nuestras peticiones Flash-Lite se cuentan con la misma tasa energética que un modelo grande. Variante realista: una quinta parte.
- La predicción kNN se indica como cota superior (milisegundos de base de datos en infraestructura compartida).
- Excluido en ambos lados: entrenamiento de los modelos base, red y dispositivos. La comparación cubre la inferencia por petición.
- La memoria del chatbot no cambia el cálculo: las notas guardadas se inyectan como tokens de contexto en cada petición y nunca contienen una lista de valoraciones completa y estructurada. El caché de prompts solo reduce el coste mientras vive el caché (típicamente minutos), y nunca a cero.
- La medición de igual información es en sí conservadora: faltan las hasta 15 palabras clave por título que alimentan el texto de embedding real de MovieMind. La paridad verdadera sería aún mayor.
- Todos los factores están redondeados deliberadamente a favor del chatbot.
Fuentes
Los valores de referencia son cifras autodeclaradas por OpenAI y Google (2025), no mediciones auditadas de forma independiente. Por eso trabajamos con rangos y publicamos cada supuesto. Esto es una declaración de eficiencia sobre el cómputo utilizado, no una certificación ambiental.
Última actualización: 2026-07-28. Mediciones: peticiones reales a la API contra gemini-3.1-flash-lite (thinking: low).

