Veraltet die Technik nicht schnell?

Viele Praxen zögern bei lokaler KI aus einem verständlichen Grund: Technik werde ohnehin schnell veraltet. Aktuell beobachten wir sogar das Gegenteil: Hardware wird immer mehr wert. Chips und Speicher werden teurer – aus Gründen, die voraussichtlich auch in den nächsten Jahren anhalten.

1. Die Nachfrage explodiert

Weltweit kaufen riesige Datenzentren (sog. Hyperscaler) enorme Mengen an GPUs und Speicher auf. Der Wettbewerb um leistungsfähige Hardware treibt die Preise weiter nach oben.[1][2]

Die RTX 5090 gibt es erst seit Januar 2025 – zu kurz für eine Fünfjahreskurve. Deshalb zeigen wir die NVIDIA GeForce RTX 4090: das vorherige Flagship, das seit dem Launch 2022 teurer geworden ist statt günstiger.

NVIDIA GeForce RTX 4090 Straßenpreis (Neu, USD), Okt 2022–Aug 2026 Der RTX-4090-Neupreis stieg von 1'599 USD zum Launch auf rund 2'940 USD im August 2026. NVIDIA GeForce RTX 4090 – Neupreis US-Straßenpreis, 2022–2026 · RTX 5090 existiert erst seit Jan. 2025 $1,600$2,000$2,400$2,800$3,200 MSRP $1'599 Okt 22Jun 23Dez 23Mär 24Apr 26Aug 26 Quellen: Tom’s Hardware, GPU PRIX, Amazon / Marktübersicht 2026
US-Neupreis der RTX 4090: Launch 1'599 USD (Okt. 2022), Tief um 1'550 USD (Juni 2023), über 2'000 USD nach den China-Exportkontrollen (Dez. 2023), rund 2'940 USD im August 2026.[3][4]

2. Die Produktionskapazität bleibt eng

Weder Stromnetze noch die Fertigung hochmoderner Chips lassen sich selbst mit grossen Investitionen beliebig ausweiten. Laut der IEA stehen Netze bereits unter Druck; rund 20 % geplanter Datencenter-Projekte drohen Verzögerungen.[5]

Moderne Chips brauchen zudem EUV-Maschinen – und die kann weltweit nur eine Firma herstellen. Diese Engpässe bleiben mindestens bis Ende des Jahrzehnts relevant.[6]

ASML-EUV-Lithografiemaschine auf weissem Grund
EUV-Lithografie: ohne diese Maschinen entstehen keine führenden KI-Chips. ASML ist weltweit der einzige Hersteller.[6]

3. Modelle werden laufend besser

Software und Laufzeitumgebungen werden effizienter; dadurch kann dasselbe System mit der Zeit sogar leistungsfähigere Aufgaben übernehmen. Heute erreichen Modelle mit deutlich weniger aktivem Rechenaufwand oft das, wofür früher deutlich grössere Modelle nötig waren – etwa durch:

  • Mixture-of-Experts – nur ein Teil der Parameter wird pro Anfrage aktiv[7]
  • Sparsame Attention-Verfahren wie Sliding Window Attention – weniger Aufwand bei langen Texten[8]
  • Grouped-/Multi-Query-Attention – weniger Speicher und Bandbreite[9]
  • Quantisierung – gleiche Fähigkeit bei kleinerem Speicherbedarf[10]

Bessere Trainingsdaten und Destillation verstärken diesen Trend zusätzlich.

Für den Praxisalltag zählt nicht der letzte Index-Punkt: Modelle, die auf einer 32-GB-Klasse laufen, erreichen die Cloud-Frontier typischerweise mit wenigen Monaten Abstand. Qwen3.8 27B (Aug. 2026) liegt auf dem Artificial Analysis Intelligence Index gleichauf mit GPT-5.6 Luna – lokal, ohne Cloud.[11][12]

AA Intelligence Index: Cloud-Frontier vs. Local Frontier (32-GB-Klasse) Stufenlinien des jeweiligen Bestwerts. Lokal endet bei Qwen3.8 27B (Index 52, August 2026). Cloud-Frontier bei Claude Opus 5 (63). AA Intelligence Index v4.1.1 (current ruler, retrospective) 0102030405060 CLOUD FRONTIERLOCAL FRONTIERJan–Apr 2026: +23 pts Mistral 7B27 Sep 2023Phi-3 Mini23 Apr 2024Llama 3.1 8B8 Jul 2024R1-Distill 32B20 Jan 2025Qwen3 30B-A3B22 Jul 2025GLM-4.7-Flash19 Jan 2026Qwen3.5 27B15 Feb 2026Qwen3.6 27B22 Apr 2026Qwen3.8 27B14 Aug 2026 Claude Opus 5 (max) · 63Claude Fable 5 · 62GPT-5.6 Sol (max) · 61Kimi K3 · 57Qwen3.8-Max · 57Claude Opus 4.8 (max) · 56Claude Sonnet 5 (max) · 55Grok 4.5 · 54GLM-5.2 · 53Qwen3.8 27B · 52GPT-5.4 (xhigh) · 51DeepSeek V4 Flash · 50Gemini 3.1 Pro · 48Qwen3.7-Max · 46Claude Opus 4.6 (max) · 44Claude Opus 4.5 · 42Gemini 3 Pro · 40GPT-5.1 (high) · 39Claude Sonnet 4.5 · 37GPT-5 (high) · 35Claude 4 Opus · 33o3 · 31Claude 3.7 Sonnet · 27Claude 4 Sonnet · 25o1 · 23Claude 3 Opus · 12GPT-4o · 11Claude 3.5 Sonnet · 10GPT-4 Turbo · 8Claude 3 Sonnet · 5GPT-3.5 Turbo · 4 202420252026 model release date
Artificial Analysis Intelligence Index v4.1.1, rückgerechnet auf eine Skala. Schwarz: jeweiliges Cloud-Frontier-Modell. Blau: jeweiliges Local-Frontier-Modell, das auf 32 GB läuft. Qwen3.8 27B (Aug. 2026) erreicht Index 52.[11][12]

Was das für Ihre Praxis bedeutet

Aufgrund dieser Entwicklungen bemisst sich der Wert einer GPU immer weniger daran, wie neu sie ist – sondern daran, wie viel Zeit und Kosten sie den Nutzenden spart. Läuft in Ihrer Praxis ein lokales System, das den Job zuverlässig erledigt, spielt es nicht unbedingt eine Rolle, ob es in Zukunft noch leistungsfähigere Hardware gibt.

Wir dimensionieren Ihr System mit Reserven und setzen auf erweiterbare, aktualisierbare Komponenten.

Viele grosse Firmen – inklusive Spitäler – investieren deshalb jetzt in Hardware. Auch Arztpraxen sollten hier nicht aussen vor bleiben: Ein früherer Einstieg sichert leistungsfähige Technik und schützt vor weiteren Preissteigerungen.

Cloud ist oft subventioniert – und wird teurer

Ein weiteres Problem: Cloud-Angebote sind derzeit oft stark subventioniert, der In-House-Compute-Bedarf der Anbieter, um noch bessere Modelle zu trainieren, steigt gleichzeitig weiter. Frontier-/AGI-Entwicklung wird zum Teil vor Inferenz priorisiert,[13] und Flat-rate-/Token-Subventionen werden zunehmend zurückgenommen.[14] In Zukunft ist deshalb mit deutlichen Preisanstiegen bei Cloud-Anbietern zu rechnen.

Lokale Infrastruktur kehrt dieses Risiko um: Einmal investiert, bleibt die Kapazität in Ihrer Praxis – unabhängig von fremden Preislisten und Kapazitätsengpässen.

Quellen

  1. Reuters: Chip crunch and memory prices
  2. J.P. Morgan: AI-driven DRAM shortage
  3. Tom’s Hardware: RTX-4090-Preisanstieg 2023
  4. GPU PRIX: GeForce RTX 4090, Stand 20. August 2026
  5. IEA: Energy and AI, Executive Summary
  6. Enverus: ASML EUV as a limit on the AI buildout
  7. Mixtral of Experts (arXiv:2401.04088)
  8. Mistral 7B, Sliding Window Attention (arXiv:2310.06825)
  9. Grouped-Query Attention (arXiv:2305.13245)
  10. AWQ: Activation-aware Weight Quantization (arXiv:2306.00978)
  11. r/LocalLLaMA: The local frontier is now smarter than Sonnet 4.5 (AA Intelligence Index v4.1.1, Cloud vs. Local Frontier)
  12. Artificial Analysis: Qwen3.8 27B (Index 52, 14. Aug. 2026) · Intelligence Index v4.1.1
  13. Alphabet: Compute-Priorität Frontier/AGI vor Cloud-Kunden
  14. Analyse zum Ende der Token-Subventionen

Bereit für lokale Praxis-KI?

Get Started