Fachartikel · Methodik

Wie viel Energie kostet eine KI-Filmempfehlung?

Warum eine kluge Datenarchitektur rohe Rechenleistung schlägt: die vollständige Rechnung hinter den MovieMind-Effizienzwerten, gemessen an realen Anfragen.

Kurzfassung

Eine Rating-Vorhersage ist bei MovieMind eine Datenbankabfrage und verbraucht weniger als 0.001 Wh. Dieselbe Frage an einen großen Chatbot kostet nach Herstellerangaben mehr als das 1.000-Fache. Einen ganzen Monat MovieMind-Nutzung per Chatbot nachzubauen würde mindestens 20-mal mehr Energie verbrauchen, bei gleicher Informationsbasis 80- bis 350-mal mehr. Der Grund ist keine Magie, sondern Architektur: Wir berechnen das Wissen über Filme und Geschmack genau einmal und teilen es über alle Nutzer, während ein Chatbot es bei jeder Anfrage neu herleiten muss. Die Empfehlungen werden dadurch nicht schlechter, sondern persönlicher.

Die These: Intelligenz gehört in die Daten, nicht in jede Anfrage

Große Sprachmodelle beantworten jede Frage, indem sie ihr gesamtes Weltwissen zur Laufzeit aktivieren. Das ist beeindruckend, aber verschwenderisch, sobald dieselbe Aufgabe tausendfach wiederkehrt. Eine Filmempfehlung braucht kein Weltwissen bei jedem Aufruf. Sie braucht ein präzises, wiederverwendbares Verständnis von Filmen und von deinem Geschmack.

MovieMind legt dieses Verständnis in die Datenpipeline. Jeder Film wird genau einmal als Vektor eingebettet, mit Beschreibung, Genres, Regie und Schlagwörtern, und dieses Wissen teilen sich alle Nutzer. Dein Geschmack liegt als Struktur über deinen eigenen Bewertungen daneben. Eine Vorhersage ist dann nur noch eine Nachbarschaftssuche in diesem Raum, und eine Sprachsuche nur noch ein kleiner Sprachschritt über vorgefilterten Kandidaten. Datenstruktur ersetzt Rechenleistung. Genau daraus entstehen die gemessenen Faktoren dieses Artikels.

Der Beispielnutzer

Alex hat 120 Filme bewertet und nutzt MovieMind einen Monat lang typisch: 20 Vibe-Suchen in natürlicher Sprache, 1 Profil-Zusammenfassung und 250 Rating-Vorhersagen. Die Vorhersagen sind keine Randgröße: Jede Vibe-Suche zeigt für alle 6 Ergebnisse eine persönliche Vorhersage an, das sind allein 120 im Monat, dazu kommen gut 4 pro Tag beim Stöbern in Listen und Detailansichten. Alle MovieMind-Werte in diesem Artikel wurden am 2026-07-28 mit realen API-Anfragen gemessen (Modell: gemini-3.1-flash-lite (thinking: low)), nicht geschätzt.

Die Messwerte

Token-Verbrauch realer, produktionsidentischer Anfragen:

Vibe-Suche (MovieMind)
1042 Input + 725 Output + 128 Reasoning = 1895 Tokens
Profil-Zusammenfassung (MovieMind)
509 Tokens
Rating-Vorhersage (MovieMind)
0 LLM-Tokens, eine pgvector-Datenbankabfrage, unter 0.001 Wh
Chatbot-Äquivalent einer Vorhersage (nur Titel + Bewertung)
2667 Input-Tokens für die eingefügte Bewertungsliste (per countTokens verifiziert), gesamt rund 3300 Tokens
Chatbot-Äquivalent bei gleicher Informationsbasis
11.425 Input-Tokens für 120 Titel mit Beschreibung, Genres, Regie und Tagline je Titel (per countTokens gemessen, rund 95 Tokens je Titel), gesamt rund 12.100 Tokens

Messung 1: Die Sprachsuche, 2- bis 10-mal sparsamer

Wo Sprache verstanden werden muss, nutzt auch MovieMind ein Sprachmodell, aber das kleinstmögliche seiner Klasse mit gedrosseltem Reasoning: gemessene 1895 Tokens pro Vibe-Suche, davon nur 128 Reasoning-Tokens. Die eigentliche Empfehlungsintelligenz steckt nicht im Modell, sondern in der vorgeschalteten Vektorsuche, die aus tausenden Titeln 18 Kandidaten filtert, bevor das Modell überhaupt läuft. Ein großer Chatbot bräuchte für dieselbe Aufgabe deine Historie im Kontext, rund 3.900 Tokens oder etwa 1,3 Wh. Je nach Modellannahme ergibt das den Faktor 2 (konservativ: unser kleines Modell wie ein großes gezählt) bis 10 (realistisch).

Der Vorteil ist nicht statisch: Er wächst mit jedem Film, den du bewertest. Stell dir vor, du pflegst deine Bewertungen in einer Tabelle und gibst sie ChatGPT bei jeder Suche als Kontext mit. Diese Liste wächst mit jedem Filmabend. Die Suchkosten von MovieMind bleiben dagegen konstant bei 1895 Tokens, weil die Empfehlungsintelligenz in vorberechneten Embeddings und der pgvector-Suche steckt, nicht im LLM-Prompt. Das Sprachmodell wählt lediglich aus 18 vorgefilterten Kandidaten aus und formuliert die Begründung.

Bewertete FilmeChatbot-TokensMovieMind-TokensEnergiefaktor
1203.9001.8952–10×
50012.2601.8956–32×
1.00023.2601.89512–61×
1.80040.8601.89522–108×

Die Formel ist transparent: Chatbot-Kontext = 1.260 Overhead-Tokens (Systemprompt, Anfrage, Ausgabe, Reasoning) + 22 Tokens pro bewertetem Titel. MovieMind bleibt bei 1895 Tokens, unabhängig von der Sammlungsgröße. Die konservative Untergrenze zählt Flash-Lite mit derselben Energierate wie ein großes Chatbot-Modell; die realistische Obergrenze mit einem Fünftel.

Messung 2: Die Rating-Vorhersage, mehr als 1.000-mal sparsamer

MovieMind beantwortet die Frage, wie gut dir ein Film gefallen würde, ganz ohne Sprachmodell: als similarity-gewichteten Schnitt der ähnlichsten Titel, die du bereits bewertet hast. Das ist eine Datenbankabfrage mit einer oberen Schranke von 0.001 Wh. Ein Chatbot hat keinen Speicher für deine Filmgeschichte, sie muss bei jeder einzelnen Anfrage neu in den Prompt. Die Untergrenze ist eine bloße Titel-und-Bewertung-Liste: gemessene 2667 Tokens bei 120 Titeln, gesamt rund 3300 Tokens, etwa 1,1 Wh, Faktor über 1.000. Diese Untergrenze ist bewusst chatbot-freundlich, denn sie unterstellt, dass das Modell jeden Titel sicher aus dem Training kennt. Das stimmt für Blockbuster, aber nicht verlässlich für Nischen-Titel, Neuerscheinungen nach dem Trainingsstand oder mehrdeutige Titel. Für dieselbe Informationsbasis, mit der MovieMind rechnet (Beschreibung, Genres, Regie und Tagline zu jedem bewerteten Titel), haben wir den Prompt aus 120 echten Titeln nachgebaut und gemessen: 11.425 Input-Tokens, gesamt rund 12.100 Tokens, etwa 4,1 Wh, Faktor rund 4.000. Der Abstand wächst mit der Sammlung: Bei 500 bewerteten Titeln sind es rund 48.200 Tokens, etwa 16 Wh, Faktor rund 16.000. Die MovieMind-Abfrage bleibt konstant, unabhängig von der Größe der Sammlung.

Messung 3: Ein ganzer Monat, mindestens 20-mal, realistisch bis 350-mal sparsamer

Alex' MovieMind-Monat: 20 Vibe-Suchen und 1 Zusammenfassung ergeben rund 38.000 LLM-Tokens, dazu 250 Vorhersagen als Datenbankabfragen, die zusammen weniger als 0,3 Wh kosten. Gesamt etwa 3 bis 13 Wh. Derselbe Nutzen per Chatbot kostet schon in der chatbot-freundlichen Titel-Listen-Variante rund 900.000 Tokens oder etwa 300 Wh. Bei gleicher Informationsbasis, also mit Beschreibungen in jeder Anfrage, sind es rund 3,3 Millionen Tokens oder etwa 1.100 Wh, Faktor 80 bis 350. Der strukturelle Grund bleibt derselbe: MovieMind berechnet das Embedding eines Films genau einmal und teilt es über alle Nutzer, ein Chatbot leitet das Geschmacksverständnis in jeder Session neu her.

Warum die Qualität dabei steigt, nicht sinkt

Effizienz klingt nach Kompromiss. Hier ist sie das Gegenteil. Ein Chatbot kennt deinen Geschmack nur, wenn du ihm deine komplette Bewertungsliste bei jeder Frage mitlieferst, und selbst dann muss er sie aus einer Textliste neu erschließen. MovieMind rechnet dauerhaft mit deiner vollständigen Bewertungsgeschichte in demselben Vektorraum, in dem auch die Filme liegen. Jede neue Bewertung schärft das Bild, ohne dass irgendetwas neu erklärt werden muss. Eine Empfehlung ist damit keine Meinung eines Modells, sondern eine nachvollziehbare Ableitung aus deinen eigenen Urteilen.

Annahmen und Umrechnung

  • Umrechnung: 0,34 Wh pro durchschnittlicher Chatbot-Anfrage (OpenAI) bei angenommen rund 1.000 verarbeiteten Tokens, Energie proportional zur Token-Zahl skaliert.
  • Konservative Variante: Unsere Flash-Lite-Anfragen werden mit demselben Energiesatz gezählt wie ein großes Chatbot-Modell. Realistische Variante: ein Fünftel davon, da Lite-Modelle deutlich kleiner sind.
  • Die kNN-Vorhersage ist als obere Schranke angesetzt (wenige Millisekunden Datenbankzeit auf geteilter Infrastruktur).
  • Nicht enthalten auf beiden Seiten: Training der Basismodelle, Netzwerk und Endgeräte. Der Vergleich betrifft die Inference pro Anfrage.
  • Chatbot-Memory ändert an der Rechnung nichts: Gespeicherte Notizen werden bei jeder Anfrage als Kontext-Tokens eingespeist und halten keine vollständige, strukturierte Bewertungsliste. Prompt-Caching senkt die Kosten nur, solange der Cache lebt (typisch Minuten), und nie auf null.
  • Die Gleiche-Informationsbasis-Messung ist selbst konservativ: Die bis zu 15 Schlagwörter je Titel, die in den echten MovieMind-Embedding-Text einfließen, fehlen im nachgebauten Prompt. Der wahre Gleichstand läge also noch höher.
  • Alle Faktoren sind bewusst zugunsten des Chatbots gerundet.

Quellen

Die Referenzwerte sind Herstellerangaben von OpenAI und Google (Stand 2025) und keine unabhängig auditierten Messungen. Deshalb rechnen wir mit Spannen statt Punktwerten und legen jede Annahme offen. Dies ist eine Effizienz-Angabe zur eingesetzten Rechenleistung, keine Umwelt-Zertifizierung.

Zuletzt aktualisiert: 2026-07-28. Messwerte: reale API-Anfragen gegen gemini-3.1-flash-lite (thinking: low).