ZUMENTIQ

KI & Digitalisierung

Was kostet eine KI-Anfrage wirklich? Google, ChatGPT und die Rechenzentren dahinter

Strom ist nur ein Teil der KI-Rechnung. Was Suche, ChatGPT und Rechenzentren tatsächlich kosten – mit transparenten Beispielen für Schweizer KMU.

Die falsche Frage: «Wie viel teurer ist KI als Google?»

Eine Google-Suche kostet nichts. Eine Frage an ChatGPT ebenfalls – zumindest sieht man häufig keine einzelne Rechnung. Gleichzeitig werden Milliarden in Rechenzentren investiert. Wie passt das zusammen? Ganz einfach: Der Preis an der Oberfläche sagt wenig über die Infrastruktur dahinter aus. Wer daraus einen festen Faktor «KI braucht zehnmal mehr Strom» ableitet, überspringt die wichtigsten Fragen.

Suchen wir eine Telefonnummer, formulieren wir eine E-Mail oder lassen wir einen Agenten zwanzig Dokumente vergleichen? Das sind unterschiedliche Leistungen. Für Schweizer KMU zählt nicht die billigste Anfrage, sondern der Aufwand bis zu einem brauchbaren, überprüften Ergebnis. Trotzdem lohnt sich ein Blick unter die Motorhaube: Er erklärt, wo Kosten entstehen und welche Stellschrauben tatsächlich etwas bringen.

Quellenstand: 18. September 2026. Herstellerangaben, Forschungsschätzungen und eigene Rechenbeispiele sind im Folgenden ausdrücklich getrennt. Eine exakte aktuelle Vollkostenrechnung pro Google- oder ChatGPT-Anfrage ist öffentlich nicht verfügbar.

Drei Rechnungen, die nicht dasselbe messen

Endkundenpreise sind Abonnements, Lizenzen oder nutzungsabhängige API-Gebühren. Ein Pauschalabo verteilt sich auf Ihre tatsächliche Nutzung; daraus folgt kein technischer Stückpreis. Auch eine werbefinanzierte Suche ist nicht kostenlos zu betreiben. Die Rechnung wird lediglich anders bezahlt.

Betreiberkosten umfassen Hardware, Abschreibung, Finanzierung, Personal, Netzwerk, Gebäude, Wartung und Energie. Je nach Betrachtung kommen Forschung, Training und Produktentwicklung dazu. Der zusätzliche Aufwand einer weiteren Anfrage ist nicht identisch mit ihren anteiligen Vollkosten. Ein günstiger Verkaufspreis beweist deshalb weder tiefe Kosten noch einen Gewinn.

Stromkosten sind nur verbrauchte Energie mal Tarif. Dazu ein bewusst einfaches Beispiel: 0,3 Wh entsprechen 0,0003 kWh. Bei angenommenen 0,15–0,30 CHF/kWh sind das 0,000045–0,000090 CHF, also 0,0045–0,009 Rappen. Das ist weder ein ChatGPT-Tarif noch dessen nachgewiesene Kostenstruktur. Es zeigt lediglich: Eine winzige Stromrechnung kann neben erheblichen Hardware- und Entwicklungskosten stehen.

Was der Vergleich mit der Suche wirklich hergibt

Google nannte 2009 rund 0,3 Wh pro Suche, einschliesslich anteiliger Arbeit vor der Anfrage wie der Indexerstellung. Das ist ein historischer Bezugspunkt, keine Messung der Google-Suche 2026. Eine heutige Suche mit KI-Zusammenfassung kombiniert zudem Informationsabruf mit generativer Verarbeitung. «Google» und «KI» sind keine sauber getrennten Kategorien mehr.

AnfragetypVeröffentlichte AngabeWas sie nicht belegt
Klassische Google-Suche0,3 Wh; Google, 2009Keinen aktuellen Vergleichswert
Gemini-TextantwortMedian 0,24 Wh; Produktionsdaten Mai 2025Keine Aussage über alle KI-Aufgaben
ChatGPT-AnfrageDurchschnitt 0,34 Wh; Sam Altman, Juni 2025Keine detailliert dokumentierte Messgrenze
Suche mit KI-AntwortKein belastbarer pauschaler Wert in den geprüften QuellenNicht mit Gemini Apps gleichsetzen
Lange Reasoning-AufgabeStark abhängig von Tokenmenge und AusführungKeinen festen Faktor zur klassischen Suche

Die Gemini-Studie berücksichtigt aktive Beschleuniger, CPU und Speicher, reservierte Leerlaufkapazität sowie Rechenzentrums-Overhead. Der Energiewert betrifft Inferenz, nicht Training oder den vollständigen Lebenszyklus einschliesslich Geräteherstellung und Nutzergerät. Ein Median ist kein Durchschnitt. Altmans Angabe enthält zu wenig Methodik für einen gleichwertigen Vergleich. Aus diesen Zahlen folgt deshalb ausdrücklich keine Rangliste.

Warum KI so viel rechnen muss

Beim Training lernt ein Modell anhand grosser Datenmengen: Es berechnet Vorhersagen, bewertet Fehler und verändert sehr viele Modellparameter. Das geschieht über zahlreiche Durchläufe. Diese Entwicklungsphase wird nicht bei jeder Nutzerfrage wiederholt. Ihre Kosten müssen wirtschaftlich jedoch über die spätere Nutzung oder andere Einnahmen getragen werden.

Bei der Inferenz nutzt das fertige Modell seine Parameter, um eine neue Antwort zu erzeugen. Sprache wird in Token zerlegt: kleine Textbausteine, nicht zwingend ganze Wörter. Zuerst verarbeitet das System den eingegebenen Kontext. Danach entsteht die Antwort schrittweise. Ein umfangreicher Verlauf und eine lange Ausgabe bedeuten mehr Arbeit als eine kurze, klar abgegrenzte Aufgabe.

GPUs und andere KI-Beschleuniger sind für sehr viele parallele Rechenoperationen gebaut. Sie verarbeiten die grossen Zahlenfelder eines Modells effizienter als ein gewöhnlicher Büroprozessor. Trotzdem brauchen sie schnellen Speicher, Datenverbindungen und Energie. Bei grossen Modellen arbeiten mehrere Chips zusammen. Das Übertragen von Daten und das Vorhalten von Kapazität sind Teil des Aufwands – nicht nur die eigentliche Rechnung.

Reasoning, Antwortlänge und Auslastung verändern die Rechnung

Reasoning-Systeme können vor der sichtbaren Antwort zusätzliche Token und Zwischenschritte erzeugen. Agenten rufen Werkzeuge auf, prüfen Resultate und starten weitere Modellanfragen. Eine einzige Nutzerfrage kann deshalb eine ganze Verarbeitungskette auslösen. Die Länge der sichtbaren Antwort verrät nicht den gesamten Rechenaufwand.

Eine Forschungsarbeit von Oviedo und Kollegen, Version vom 9. Juni 2026, modelliert grosse Systeme auf H100-Knoten: Für typische Anfragen liegt der geschätzte Median bei 0,31 Wh, die mittleren 50 Prozent bei 0,16–0,60 Wh. Im Szenario mit 15-facher Tokenmenge sind es 3,91 Wh beziehungsweise 2,15–7,05 Wh. Das sind Modellschätzungen für definierte Annahmen, keine Messungen sämtlicher ChatGPT-Nutzer; die Bandbreiten sind keine universellen Minimal- und Maximalwerte.

Auch Auslastung zählt. Werden mehrere Anfragen gemeinsam verarbeitet, verteilt sich Infrastrukturaufwand auf mehr Ergebnisse. Reserven für Spitzenlast und schnelle Antworten kosten dagegen auch dann Geld, wenn sie gerade wenig Arbeit erledigen. Darum lässt sich aus der maximalen Wattzahl einer GPU allein kein seriöser Verbrauch pro Anfrage berechnen.

Was eine API-Anfrage kosten kann

Ein überprüfbares Preisbeispiel bietet Anthropics Preisliste: Claude Sonnet 4.6 kostet im Standardtarif 3 USD pro Million Eingabe- und 15 USD pro Million Ausgabetoken, abgerufen am 18. September 2026. Das ist ein konkretes Modellbeispiel, keine Empfehlung für das jeweils neueste oder günstigste Modell. Andere Tarife, Regionen und Zusatzdienste können abweichen.

Bei 2’000 Eingabe- und 500 Ausgabetoken ergibt die eigene Rechnung 0,006 + 0,0075 = 0,0135 USD, also 1,35 US-Cent. Bei 20’000 Eingabe- und 5’000 abrechenbaren Ausgabetoken sind es 0,135 USD. Cache-Rabatte, Batch-Verarbeitung, Werkzeuge und Steuern bleiben hier bewusst aussen vor. Beides sind Verkaufspreise, keine Strommessungen.

Für eine Offerte rechnen Sie deshalb mit dem gesamten Vorgang: Wie viele Modellaufrufe, Wiederholungen und Prüfungen entstehen pro erledigter Aufgabe? Ein kleiner Preis pro Token kann bei langen Dokumenten und ungebremsten Agentenschleifen relevant werden. Umgekehrt kann ein teureres Modell wirtschaftlicher sein, wenn es deutlich weniger Korrekturen braucht.

Was ein Rechenzentrum kostet: Gebäude ist nicht Computer

Der Baukostenindex 2025–2026 von Turner & Townsend nennt für Zürich rund 14,2 USD pro Watt IT-Kapazität. Bei 30 MW ergibt das rechnerisch rund 426 Millionen USD. Dieser Benchmark betrifft luftgekühlte Hyperscale-Anlagen, typischerweise 30–50 MW. Er ist keine Schweizer Offerte und kein Preis für ein vollständig bestücktes KI-Rechenzentrum.

Die Methodik umfasst Bau sowie mechanische und elektrische Ausstattung; unter anderem aktive IT, Grundstück, externe Versorgungsarbeiten und professionelle Planungshonorare sind ausgeschlossen. Transformatoren, Notstrom und Kühlung gehören zur Infrastruktur. Server, GPUs, Speicher und Datennetze sind eine weitere Rechnung.

Wie gross diese zweite Rechnung sein kann, zeigt IRENs Mitteilung vom 3. November 2025: rund 5,8 Milliarden USD für GPUs und ergänzende Ausstattung für eine geplante Bereitstellung mit 200 MW IT-Last. Enthalten sind auch Server, Vernetzung, Software und Bereitstellungsleistungen. Die ebenfalls genannten 9,7 Milliarden USD sind dagegen ein fünfjähriger Kundenvertrag, keine Baukosten. Dieses US-Projekt lässt sich nicht einfach auf Zürich übertragen.

Ein transparentes Rechenbeispiel für Investition und Betrieb

Für eine Vorstellung der Grössenordnung folgt ein eigenes hypothetisches 10-MW-Szenario, keine Marktofferte. Die Bandbreiten sind frei gewählte Sensitivitätsannahmen, keine statistischen Konfidenzintervalle. Sie sollen sichtbar machen, welche Angaben in einer seriösen Kalkulation fehlen würden.

PositionExplizite AnnahmeErgebnis
Gebäude und technische Infrastruktur10 MW × 10–15 Mio. CHF/MW100–150 Mio. CHF
IT inklusive GPU-SystemenSeparater Budgetrahmen150–300 Mio. CHF
Investitions-ZwischensummeOhne Grundstück, externe Erschliessung, Finanzierung, Steuern und weitere Projektkosten250–450 Mio. CHF
Jährlicher Strom70 % mittlere elektrische IT-Last, PUE 1,20, 8’760 Stunden73,584 GWh
Jährliche Stromrechnung0,10–0,20 CHF/kWh als angenommener effektiver TarifRund 7,4–14,7 Mio. CHF

Unterstellen wir zusätzlich für eine vereinfachte lineare Abschreibung 15 Jahre für die gesamte Infrastruktur und vier Jahre für IT, jeweils ohne Restwert, ergeben sich rund 44–85 Millionen CHF pro Jahr. Komponenten haben tatsächlich unterschiedliche Nutzungsdauern. Zusammen mit Strom wären es hier rund 52–100 Millionen CHF jährlich – bevor Personal, Wartung, Ersatzteile, Lizenzen, Versicherungen und Kapitalkosten bezahlt sind.

Das ist keine Betreiberkosten-Schätzung für OpenAI oder Google. Ohne produktiven Durchsatz, Aufgabenmix und Lebensdauerannahmen lässt sich daraus auch kein Stückpreis pro Anfrage ableiten. Gerade diese fehlenden Grössen erklären, weshalb scheinbar präzise Internetrechnungen häufig täuschen.

MW, kWh und PUE: drei Begriffe für die richtige Grössenordnung

MW ist Leistung: wie viel elektrische Energie pro Zeit aufgenommen werden kann oder gerade aufgenommen wird. kWh ist Energie: Leistung mal Dauer. Ein Megawatt während einer Stunde entspricht 1’000 kWh; eine GWh entspricht einer Million kWh. Die Kapazitätsangabe eines Campus ist deshalb noch keine Jahresverbrauchszahl.

Im Beispiel sind 10 MW × 70 Prozent = 7 MW durchschnittliche elektrische IT-Last. Das bedeutet nicht 70 Prozent GPU-Rechenauslastung; beide Grössen sind verschieden. PUE 1,20 bedeutet, dass für 1 kWh IT-Energie insgesamt 1,20 kWh im Rechenzentrum anfallen. Daher: 7 × 1,20 × 8’760 = 73’584 MWh. Die zusätzlichen 20 Prozent beziehen sich auf IT-Energie; am Gesamtverbrauch machen sie rund 16,7 Prozent aus.

Kühlung, Stromwandlung und weitere Gebäudetechnik verursachen diesen Zusatzbedarf. PUE allein sagt nichts über den Nutzen der Berechnung oder deren CO₂-Bilanz. Auch Wasserverbrauch und Herstellungsaufwand brauchen separate Grenzen. Als greifbarer Vergleich: 1 Wh betreibt eine 10-Watt-LED sechs Minuten. Das ist eine Energiegleichheit, keine umfassende Umweltbewertung.

Kleine Einzelanfrage, grosse Gesamtwirkung

Die IEA beziffert in ihrer Aktualisierung 2026 den weltweiten Rechenzentrumsverbrauch 2025 auf rund 485 TWh und prognostiziert etwa 950 TWh für 2030. Die zweite Zahl ist ein Szenario, keine bereits gemessene Zukunft. Beide Werte umfassen Rechenzentren insgesamt, nicht nur generative KI.

Der scheinbare Widerspruch verschwindet mit der Menge: Milliarden kleiner Vorgänge, mehr Videos, längere Kontexte und automatisierte Dauerschleifen summieren sich. Effizientere Chips senken den Aufwand pro Aufgabe; zusätzliche Nutzung kann diesen Gewinn überholen. Für ein KMU ist weder pauschales Vermeiden noch sorgloses Automatisieren die sinnvolle Konsequenz. Entscheidend ist, unnötige Verarbeitung wegzulassen und nützliche Verarbeitung bewusst zu budgetieren.

Fünf konkrete Entscheidungen für Schweizer KMU

  • Aufgaben trennen: Für eine bekannte Adresse genügt Suche. Für Zusammenfassen oder Entwerfen kann ein kleines Modell reichen. Reasoning dort einsetzen, wo zusätzliche Prüfung messbar hilft.
  • Ein echtes Testset verwenden: Zwanzig typische Vorgänge vergleichen. Modellpreis, Bearbeitungszeit, Fehler und Nacharbeit dokumentieren; keine vertraulichen Inhalte in unfreigegebene Dienste kopieren.
  • Kontext begrenzen: Relevante Abschnitte statt ganzer Archive senden. Gewünschte Antwortlänge nennen und wiederverwendbare Informationen sinnvoll zwischenspeichern.
  • Automationen deckeln: Budgets, maximale Durchläufe, Zeitlimits und menschliche Freigaben setzen. Eine Wiederholungsschleife darf nicht unbegrenzt weiterlaufen.
  • Betriebskosten vollständig vergleichen: Bei Eigenbetrieb auch geringe Auslastung, Betreuung und Hardwareersatz rechnen. Bei Cloud-Angeboten Integration, Datenhaltung und Kontrolle berücksichtigen.

Meine Empfehlung: Beginnen Sie mit einem häufigen, risikoarmen Vorgang und einem klaren Erfolgskriterium. Erst wenn Qualität und Gesamtkosten stimmen, lohnt sich die Skalierung. Ein gesparter Rappen am Modell hilft wenig, wenn jemand anschliessend zehn Minuten länger korrigiert.

Fazit: Nicht jeder Prompt braucht ein Kraftwerk

Eine kurze Textanfrage kann sehr wenig Strom benötigen. Daraus folgt nicht, dass KI-Infrastruktur billig ist. Die Milliarden stecken vor allem in einer Kombination aus Kapazität, Hardware und zuverlässigem Betrieb. Umgekehrt macht ein grosses Rechenzentrum nicht jede einzelne Nutzung verschwenderisch. Wer Kostenarten, Messgrenzen und tatsächlichen Nutzen trennt, trifft bessere Entscheidungen als mit jedem pauschalen «KI versus Google»-Faktor.

Welche KI-Anwendung lohnt sich für Ihr KMU?

Wir prüfen Anwendungsfall, Qualität und Gesamtkosten gemeinsam – bevor aus einem Experiment ein laufendes Budget wird.

Kostenloses Erstgespräch vereinbaren