En vous promenant sur AEGIS IA LOCALE, nous stockons votre IP 48h pour des raisons de sécurité.

Nachhaltige Entwicklung & lokale KI

Kein Greenwashing, sondern Zahlen, die zeigen, worin wir gut sind!

Das Problem

KI verbraucht. Viel. Das ist nicht schlimm, außer wenn die Rechnung kommt.

Wir erzählen Ihnen nicht die Masche „Retten Sie den Planeten mit unserer grünen KI“, während wir einfach dieselben Modelle laufen lassen wie alle anderen. Dafür können wir Ihnen erklären, warum eine lokale AEGIS-IA-Infrastruktur langfristig deutlich weniger verbraucht als ein Cloud-Abonnement.

Bereit für ein bisschen Physik und Mathe?

Was ein Cloud-LLM wirklich verbraucht

Eine aktuelle wissenschaftliche Studie (Jegham et al., 2025) hat den tatsächlichen Verbrauch großer kommerzieller LLMs gemessen, und die Zahlen machen Angst:

📊 Verbrauch pro Anfrage (Cloud-Modelle)

  • GPT-4o : 0,43 Wh pro kurzer Anfrage
  • o3 (OpenAI) : 39,2 Wh pro langem Prompt (70-mal mehr als ein Nano-Modell)
  • DeepSeek-R1 : 33,6 Wh pro langem Prompt

Quelle: Jegham et al. (2025), „How Hungry is AI? Benchmarking Energy, Water, and Carbon Footprint of LLM Inference“, arXiv:2505.09598

Zur Einordnung: Eine einzige lange Anfrage an o3 verbraucht so viel Strom wie ein 65-Zoll-LED-Fernseher in 20–30 Minuten Betrieb.

Multiplizieren wir das jetzt mit 700 Millionen Anfragen pro Tag (vorsichtige Schätzung für GPT-4o im Jahr 2025):

  • Jährlicher Stromverbrauch : 391 509 bis 463 269 MWh – so viel wie 35 000 amerikanische Haushalte oder fast 77 000 europäische Haushalte (Vergleich der Daten von Enedis und der US-EIA)
  • Verdunstetes Wasser (Kühlung der Rechenzentren): 1,33 bis 1,58 Millionen Kubikmeter – genug, um 500 olympische Schwimmbecken zu füllen
  • CO₂-Emissionen : 138 125 bis 163 441 Tonnen CO₂ – so viel wie 30 000 Benzinautos

Und dabei sprechen wir voneinem einzigen Modell. Rechnen Sie Gemini, Mistral und all die anderen dazu …

Das Jevons-Paradoxon, angewandt auf KI

Kennen Sie das Jevons-Paradoxon? Je effizienter man etwas macht, desto mehr nutzen es die Leute (denken Sie an die Autobahn nach Luxemburg 😂), sodass am Ende trotz Optimierung mehr verbraucht wird.

Genau das passiert bei Cloud-LLMs:

  • GPT-4o ist pro Anfrage effizienter als GPT-3
  • Also nutzen die Leute es 10-mal mehr
  • Ergebnis: Der Gesamtverbrauch explodiert

Eine Google-Anfrage verbraucht 0,30 Wh. Eine GPT-4o-Anfrage verbraucht 0,43 Wh. Das sind 40 % mehr. Nicht viel? Multiplizieren Sie das jetzt mit Milliarden von Anfragen pro Tag.

Die versteckte Infrastruktur der Rechenzentren

Was man Ihnen nicht sagt: Die obigen Zahlen sind deutlich UNTERSCHÄTZT.

Warum? Weil Rechenzentren nicht nur Strom verbrauchen, um die GPUs zu betreiben. Sie verbrauchen auch für:

  • Kühlung : 40–54 % des Gesamtverbrauchs eines Rechenzentrums
  • Netzwerke und Infrastruktur : Router, Switches, aktive Verkabelung
  • Redundanz : Notstromversorgung, Backup-Systeme
  • Betrieblicher Overhead : Beleuchtung, Sicherheit, Monitoring
  • Und in geringerem Maße die Kosten rund um die Beschäftigten : Verpflegung, persönliche Computer, Transport

Der durchschnittliche PUE (Power Usage Effectiveness) eines Rechenzentrums liegt bei 1,5 bis 2,0. Das heißt: Für 1 Watt, das eine GPU verbraucht, braucht es zusätzlich 0,5 bis 1 Watt, nur um sie am Laufen zu halten.

Quelle: Patterson et al. (2021), „Carbon Emissions and Large Neural Network Training“

Äh, und was kostet das alles zusammen? (der Kern des Problems)

Machen wir uns nichts vor: Die Rechnung ist das, was motiviert

💰 Kostenvergleich Cloud-API vs. lokal (über 3 Jahre)

Szenario: 50 Beschäftigte, moderate Nutzung (500 Anfragen/Tag/Person)

Posten Cloud-API Lokale Infrastruktur
Jahr 1 ~60 000 € (Tokens) ~80 000 € (Hardware + Einrichtung)
Jahr 2 ~60 000 € ~15 000 € (Strom + Wartung)
Jahr 3 ~60 000 € ~15 000 €
GESAMT 3 JAHRE 180 000 € 110 000 €

Break-even: 18–24 Monate

Quelle: Berechnet nach Lenovo Press (2025), „On-Premise vs Cloud: Generative AI Total Cost of Ownership“

Und Vorsicht: Diese Zahlen setzen voraus, dass Ihre API-Preise stabil bleiben. Wir ahnen es schon: Das tun sie nicht.

OpenDings kann morgen beschließen, seine Preise zu verdoppeln. Sie können nichts tun. Sie sind Geiseln.

Mit einer lokalen Infrastruktur sinken Ihre Grenzkosten pro Anfrage mit der Zeit. Je mehr Sie sie nutzen, desto weniger kostet jede Anfrage. Und das ist genau das Gegenteil der Cloud.

Der CO₂-Fußabdruck, reden wir ernsthaft darüber

Ein durchschnittliches amerikanisches Rechenzentrum nutzt einen Strommix mit ~60 % fossilen Energien (Kohle, Gas). Bei einem europäischen Rechenzentrum sind es je nach Land eher 30–40 %.

Ihr lokaler Server bei Ihnen in Lothringen? Sie hängen am französischen Strommix: ~70 % Kernkraft + 20 % erneuerbare Energien. CO₂-Emissionen: 50–60 g/kWh.

Ein AWS-Rechenzentrum in Virginia (Region us-east-1, die gängigste)? Strommix: 40 % Gas, 35 % Kohle. Emissionen: 350–400 g/kWh.

Gleiche Rechnung, 6- bis 7-mal weniger CO₂ in Frankreich als in Virginia.

Das ist kein Greenwashing. Wir stellen nur fest, dass ein Server am EDF-Netz weniger ausstößt als ein AWS-Rechenzentrum in Virginia.

Die versteckten Kosten der Cloud

Was man bei den Cloud-TCO oft vergisst mitzurechnen:

  • Preiserhöhungen : OpenAI, Anthropic, Google können ihre Tarife ändern, wann sie wollen. Sie sind abhängig.
  • Output-Tokens 2- bis 4-mal teurer als Input-Tokens. Wenn Ihr LLM viel Text erzeugt: Überraschung.
  • Rate-Limiting-Strafen : Überschreiten Sie Ihr Kontingent, zahlen Sie das 2- bis 3-Fache pro Token.
  • Egress-Gebühren : Daten aus der Cloud herauszuholen kostet richtig Geld (AWS liebt das).
  • Enterprise-Support : +15–30 % auf die Rechnung, wenn Sie ein anständiges SLA wollen.

Ergebnis: Aus Ihrer monatlichen Rechnung von 5000 € können schnell 8000 € werden, ohne dass Sie irgendetwas geändert haben.

Quelle: MPT Solutions (2025), „The Hidden Infrastructure Cost of Running Local LLMs vs Cloud APIs“

Lokale Infrastruktur ist auch nicht umsonst

Seien wir ehrlich. Eine lokale Infrastruktur kostet auch. Das müssen Sie wirklich einrechnen:

  • Hardware : 40 000 € bis 80 000 € für eine ordentliche Konfiguration (2–4 professionelle GPUs vom Typ L40S oder A100)
  • Strom : ~5000–10 000 €/Jahr je nach Nutzung
  • Kühlung : Wenn Ihr Serverraum schlecht belüftet ist, planen Sie eine Klimaanlage ein. 2000–5000 €/Jahr.
  • Wartung : Hardware-Erneuerung alle 3–5 Jahre
  • Personal : Entweder haben Sie schon IT-Ingenieure, oder Sie müssen schulen/einstellen

Aber sobald sie amortisiert ist (18–24 Monate), sind Ihre Grenzkosten pro Anfrage verschwindend gering im Vergleich zur Cloud.

Und vor allem: Sie haben die Kontrolle. Keine Überraschungen, keine Abhängigkeit, keine unerwarteten (und oft drastischen) Erhöhungen.

Denn die wird es geben. Die Kapitalrendite großer LLMs wie ChatGPT liegt bei 3,5 US-$ Rückfluss für 5 US-$ Investition!

Das hybride Modell (die wirklich gute Idee)

Wir wollen Ihnen nichts vormachen: 100 % lokal ist nicht immer optimal. Auch wir haben unsere Herausforderungen.

Hybrid, echte Agilität:

  • Einfache, wiederkehrende Aufgaben (FAQ, Klassifizierung, Extraktion) → Lokales 7B–13B-Modell. Grenzkosten nahezu null.
  • Komplexe, gelegentliche Aufgaben (mehrstufiges Schlussfolgern, Kreativität) → Cloud-API bei Bedarf. Sie zahlen nur für das Außergewöhnliche.
  • Sensible Daten → Lokal, immer. Nicht verhandelbar.
  • Lastspitzen → Burst in die Cloud, wenn Ihre lokale Infrastruktur ausgelastet ist. Aber das ist die Ausnahme, nicht die Regel.

Ergebnis: Sie verbinden das Beste aus beiden Welten. Beherrschte Kosten, optimale Leistung, gewahrte Souveränität.

AEGIS IA gibt sich nicht als grünes Männchen aus

Wir behaupten nicht, den Planeten zu retten.

Was wir tun:

  • Wir bauen lokale Infrastrukturen auf, passend dimensioniert für Ihren Bedarf (keine unnötige Überausstattung)
  • Wir optimieren die Modelle, um den Verbrauch pro Anfrage zu senken (Quantisierung, Destillation, wo sinnvoll)
  • Wir helfen Ihnen, Ihre echten TCO zu berechnen (Cloud vs. lokal) mit ehrlichen Zahlen
  • Wir nutzen den lokalen Strommix (in Frankreich = CO₂-arm)
  • Wir vermeiden Verschwendung: keine GPU, die 90 % der Zeit im Leerlauf läuft

Das war's. Kein CO₂-Kompensationszertifikat. Nur eine effiziente Infrastruktur, die verbraucht, was sie verbrauchen muss, und nicht mehr.

Wissenschaftliche Quellen und Referenzen

Unsere Quellen:

  • Jegham et al. (2025) : „How Hungry is AI? Benchmarking Energy, Water, and Carbon Footprint of LLM Inference“, arXiv:2505.09598 – Vergleichsstudie zu 30 kommerziellen LLMs
  • Patterson et al. (2021) : „Carbon Emissions and Large Neural Network Training“, arXiv:2104.10350 – Analyse des CO₂-Fußabdrucks beim LLM-Training
  • Lenovo Press (2025) : „On-Premise vs Cloud: Generative AI Total Cost of Ownership“ – Detaillierte TCO-Analyse mit Break-even-Punkten
  • Scientific Reports (2024) : „Reconciling the contrasting narratives on the environmental impact of large language models“, Nature – Vergleich LLM vs. menschliche Arbeit
  • Strubell et al. (2019) : „Energy and Policy Considerations for Deep Learning in NLP“, ACL – Erste große Studie zum Energieverbrauch von LLMs
  • Venditti B. (2025) : Ranked: Electricity Use Per Capita in Major Global Economies

Fazit: Rechnen Sie selbst nach!

Lokale KI ist nicht immer die Lösung. Aber für 80 % der Unternehmen mit stabiler und vorhersehbarer Nutzung ist sie wirtschaftlich und ökologisch tragfähiger als die Cloud über 2–3 Jahre.

Wenn Sie mehr als 2000 €/Monat für Cloud-APIs ausgeben, ist es höchste Zeit, sich mit der Frage zu beschäftigen.

Wir können Ihnen helfen. Ohne Blendwerk, mit echten Zahlen und transparenten TCO.

Schreiben Sie uns!

de en es fr pt