KI-Kostenmodelle
Man kann KI sehr unterschiedlich beziehen – pro Token über die API, als Flat-Abo (z. B. Claude Max), pro Sitz im Team, als Enterprise-Vertrag, selbst gehostet auf eigener GPU oder EU-souverän. Diese Sicht ordnet die Optionen ein und zeigt, wann sich welche lohnt.
Bezugswege
35
Kategorien
7
Anbieter
17
Wann lohnt sich was?
- Variable / geringe Last → API (Pay-per-Token). Mit Batch (−50 %) und Prompt-Caching (~−90 %) am wirtschaftlichsten, wenn man nur echten Verbrauch zahlen will.
- Intensive interaktive Nutzung → Flat-Abo. Faustregel: Wer täglich mehrere Stunden Claude Code/Agents nutzt (grob > 200 Mio. Tokens/Monat), fährt mit Max 20× ($200 flat) deutlich günstiger als pro Token.
- Hohe, gleichmäßige Auslastung → eigene GPU. Eine H100 rund um die Uhr kostet ~$1.400–1.500/Monat (Neocloud); lohnt erst ab ~50–70 % Dauerauslastung. Darunter ist Serverless (offene Modelle) meist günstiger und einfacher.
- Datenhoheit / Compliance → EU-souverän (STACKIT, IONOS, OVHcloud, T-Systems, Aleph Alpha). Oft teurer pro Token, aber bei DSGVO/kritischer Infrastruktur ausschlaggebend.
Abo oder API? – Schnellrechner
Geschätzten monatlichen API-Verbrauch eingeben – wir zeigen, ab wann sich eine Flat-Lizenz lohnt (Annahme: interaktive Nutzung, z. B. Coding).
API-Kosten / Monat
$140.00
Anthropic Claude Sonnet 5
Empfehlung
Claude Pro
ab ~$20 API-Wert (interaktiv)
| Option | Fixpreis | Lohnt ab |
|---|---|---|
| Pay-per-Token (API) | — | immer |
| Claude Pro | $20 / Monat | ~$20.00 API-Wert |
| Claude Max 5× | $100 / Monat | ~$200.00 API-Wert |
| Claude Max 20× | $200 / Monat | ~$300.00 API-Wert |
Grobe Orientierung. Flat-Abos (Pro/Max) haben rollierende Fair-Use-Limits statt fixer Token-Zahlen und decken interaktives Arbeiten – nicht beliebige Produktions-API-Last. Bei stark schwankender oder automatisierter Last bleibt die API mit Batch- und Caching-Rabatten oft wirtschaftlicher.
API / Pay-per-Token
Nutzungsbasiert – zahlt nur echten Verbrauch. Ideal bei variabler Last und Integrationen.
| Anbieter / Plan | Preis | Enthalten | Für wen | Hinweis | Quelle |
|---|---|---|---|---|---|
Anthropic API / Pay-per-Token | nutzungsbasiert | Opus 4.8 $5/$25, Sonnet 5 $3/$15, Haiku 4.5 $1/$5 je 1M Tokens | Entwickler, produktive Integrationen, variable Last | Batch −50 %, Prompt-Caching Read ~0,1× / Write 1,25–2× | Quelle ↗ |
Google Gemini API | nutzungsbasiert | Gemini 3.1 Pro $2/$12 (>200K: $4/$18); 3.5 Flash $1,50/$9 | Entwickler/Integrationen | AI Studio gratis zum Testen; Batch −50 % | Quelle ↗ |
Mistral La Plateforme API | nutzungsbasiert | Mistral Large $2/$6 je 1M Tokens | Entwickler (EU-Anbieter) | Batch −50 %, Cached Input −90 % | Quelle ↗ |
OpenAI API / Pay-per-Token | nutzungsbasiert | GPT-5.x ~$1,25 In / ~$10 Out je 1M Tokens (modellabhängig) | Entwickler, Integrationen | Batch/Flex −50 %, Cached Input ~−90 %, Prepaid-Credits | Quelle ↗ |
xAI Grok API | nutzungsbasiert | Grok 4.5 $2/$6 (Cache $0,50); Grok 4.3 $1,25/$2,50 | Entwickler | 75 % Cache-Rabatt | Quelle ↗ |
Consumer-Abos (Flat)
Fixpreis pro Monat mit Fair-Use-Limits. Lohnt bei intensiver interaktiver Nutzung (Chat, Coding).
| Anbieter / Plan | Preis | Enthalten | Für wen | Hinweis | Quelle |
|---|---|---|---|---|---|
Anthropic Claude Max 20× | $200 / Monat | ~20× Pro (Richtwert ~220k Tokens / 5h-Fenster) | Heavy Claude-Code-Nutzer | Reale Nutzung oft $600–1.500/Monat API-Wert; non-interaktiv (CI/Agent SDK) aus separatem Budget | Quelle ↗ |
Anthropic Claude Max 5× | $100 / Monat | 5× Pro-Nutzung, höhere Output-Limits, Priority, Early Access | Intensive Einzelnutzer, tägliches Coding | Entspricht grob $200–500/Monat API-Wert | Quelle ↗ |
Anthropic Claude Pro | $20 / Monat | ~1× Basisbudget (Richtwert ~44k Tokens / 5h-Fenster), Claude Code, Research | Einzelne Power-User, moderates Coding | Nach Limit optional Usage-Credits zu API-Raten | Quelle ↗ |
Google Google AI Pro | $19,99 / Monat | 4× Nutzung vs. Free, voller Gemini 3.1 Pro, Deep Search, 5 TB | Power-User/Kreative | Gemini in Gmail/Docs | Quelle ↗ |
Google Google AI Ultra | $99,99–199,99 / Monat | 5×–20× vs. Pro, Deep Think, bis 25.000 Flow-Credits, 20+ TB | Höchstbedarf/Profis | Einstieg von $249,99 gesenkt | Quelle ↗ |
Mistral Le Chat Pro | $14,99 / Monat | Höhere Limits, ganztägiges Coding (CLI/IDE/Web), mehr Bilder | Einzel-Power-User (EU) | Education $5,99/Monat | Quelle ↗ |
OpenAI ChatGPT Plus | $20 / Monat | GPT-5.5, ~160 Nachrichten / 3h, Voice, Bildgen | Standard-Power-User | Fair-Use-Limits je Modell | Quelle ↗ |
OpenAI ChatGPT Pro | $200 / Monat | "Effektiv unbegrenzt" GPT-5.5 inkl. Reasoning, unbegrenzte Bilder | Heavy-User, Reasoning-intensiv | Unter Fair-Use / Abuse-Guardrails | Quelle ↗ |
Perplexity Perplexity Pro | $20 / Monat | Unbegrenzte Pro-Suche, 20 Deep-Research/Tag, GPT-5 & Claude Opus | Recherche-Power-User | Max $200/Monat mit Labs/Computer | Quelle ↗ |
xAI SuperGrok | $30 / Monat | Höhere Rate-Limits, voller Grok-Zugang | Power-User | SuperGrok Heavy $300/Monat für vollen Grok 4.5 | Quelle ↗ |
Team / pro Sitz
Pro Nutzer und Monat, mit Admin, SSO und Governance. Für Teams.
| Anbieter / Plan | Preis | Enthalten | Für wen | Hinweis | Quelle |
|---|---|---|---|---|---|
Anthropic Claude Team | $25 / Nutzer / Monat | Höhere Nutzung als Pro, SSO, Admin, kein Training auf Inhalten | Kleine/mittlere Teams | Min. 5 Sitze; Premium-Seat $125 (5× Nutzung) | Quelle ↗ |
Mistral Le Chat Team | $24,99 / Nutzer / Monat | 30 GB/Nutzer, Domain-Verifizierung, alle Pro-Features | Teams (EU) | Min. $50/Monat | Quelle ↗ |
OpenAI ChatGPT Business | $25 / Nutzer / Monat | Höhere Limits, Workspace, Admin, kein Training auf Daten | Teams/KMU | Min. 2 Sitze | Quelle ↗ |
Perplexity Enterprise Pro | $40 / Sitz / Monat | 400 Pro-Suchen/Woche, SSO, SCIM, Datenisolierung | Teams/Unternehmen | Rabatte ab 250+ Nutzern | Quelle ↗ |
xAI Grok Business | $30 / Sitz / Monat | SOC 2 Type II, RBAC, kein Training auf Kundendaten | KMU/Teams | Self-Serve | Quelle ↗ |
Enterprise
Verhandelte Verträge mit Compliance, SCIM, Audit-Logs, Custom Retention.
| Anbieter / Plan | Preis | Enthalten | Für wen | Hinweis | Quelle |
|---|---|---|---|---|---|
Anthropic Enterprise | ab $20 / Seat + API-Usage / Custom | SCIM, Audit-Logs, RBAC, Compliance-API, Custom Retention, HIPAA-ready | Orgs mit Compliance-Bedarf | Self-Serve oder Sales | Quelle ↗ |
Google Gemini Enterprise | ~$23–30 / Nutzer / Monat / Custom | Max. Kontingente, DLP, Identity Premium | Große Organisationen | Separates Cloud-Produkt seit Okt. 2025 | Quelle ↗ |
Mistral Le Chat Enterprise | Custom (Kontakt Sales) | Custom Models, Agents, Audit-Logs, SAML SSO, Private Deployment | Unternehmen (EU) | Drittquellen ~ab $20k/Monat (inoffiziell) | Quelle ↗ |
OpenAI Enterprise | Custom / Contact Sales | Erweiterte Kontexte, SSO/SCIM, Analytics, Compliance, Support | Große Unternehmen | Kein öffentlicher Listenpreis | Quelle ↗ |
Self-Hosting (eigene GPU)
Dedizierte GPU mieten und offene Modelle selbst betreiben. Lohnt bei hoher, gleichmäßiger Auslastung.
| Anbieter / Plan | Preis | Enthalten | Für wen | Hinweis | Quelle |
|---|---|---|---|---|---|
Hyperscaler (AWS/Azure/GCP) H100-Instanzen | ~$3–7 / GPU-Stunde | GCP ~$3/h am günstigsten; Azure ~$7/h; Spot/Reserved −25–30 % | Bestehende Cloud-Stacks | Hyperscaler-Aufschlag ggü. Neoclouds | Quelle ↗ |
Lambda On-Demand GPU (H100) | ~$2,49 / GPU-Stunde | Vorkonfigurierte ML-Umgebung; H200 ~$4,49/h | Dev-freundlich, Training | "just works" | Quelle ↗ |
RunPod On-Demand GPU (H100) | ~$1,99 / GPU-Stunde | Reine GPU – Modell selbst deployen; H100 24/7 ≈ $1.400–1.500/Monat | Günstigstes Self-Hosting, Spikes | Neocloud; A100 ~$1,19–1,39/h, L40S ~$0,79/h | Quelle ↗ |
Serverless (Open-Weights)
Offene Modelle als API bei Dritt-Hostern – oft deutlich günstiger pro Token.
| Anbieter / Plan | Preis | Enthalten | Für wen | Hinweis | Quelle |
|---|---|---|---|---|---|
DeepInfra Serverless Open-Weights | ab ~$0,05 / 1M Tokens | Llama 3.3 70B $0,23/$0,40, 8B $0,05/$0,08 | Günstigste Token-Option für offene Modelle | Oft 3–4× günstiger als Together/Fireworks | Quelle ↗ |
Groq On-Demand (LPU) | Llama 70B $0,59/$0,79 / 1M | 500+ Tokens/s, sehr schnell | Latenz-kritische Apps | Eigene LPU-Chips; Batch/Cache −50 % | Quelle ↗ |
Together AI Serverless | Llama 70B ~$0,88 / 1M | Breiter Modellkatalog, Fine-Tuning/Dedicated | Prototyping, Modellvielfalt | Auch dedizierte Endpunkte | Quelle ↗ |
EU-souverän
Datenhoheit in der EU (DE/FR). Preis oft über US-Anbietern, aber entscheidend für Compliance.
| Anbieter / Plan | Preis | Enthalten | Für wen | Hinweis | Quelle |
|---|---|---|---|---|---|
Aleph Alpha PhariaAI (Enterprise) | Enterprise / Custom (Contact Sales) | On-Prem/Sovereign-Plattform, Governance/RAG | Behörden, kritische Infrastruktur, On-Prem | Cohere-Merger 04/2026; "Command-Pharia 1" für Q4/2026 angekündigt | Quelle ↗ |
IONOS AI Model Hub | ab ~$0,17 / 1M Tokens | Open-Weights, OpenAI-kompatibel, EU-Rechenzentren | Günstige EU-Souveränität | Deutscher Anbieter | Quelle ↗ |
OVHcloud AI Endpoints | $0,05–1,01 In / $0,11–4,25 Out pro 1M | 40+ Open-Source-Modelle, FR-Hosting (Gravelines) | Serverloses EU-Hosting | Llama/Mistral/Qwen | Quelle ↗ |
STACKIT (Schwarz-Gruppe) AI Model Serving | ~0,45 € / 0,65 € pro 1M Tokens | Open-Weights, DE-Hosting, volle Datensouveränität; Embedding 0,02 €/1M | Souveräne DE-Workloads | Deutsche Cloud | Quelle ↗ |
T-Systems AI Foundation Services | ~0,20 € / 0,65 € pro 1M + Mindestumsatz | 30+ LLMs, OpenAI-kompatibel, DE/CH-Hosting | Regulierte Branchen, DSGVO | Dedicated = feste HW-Miete | Quelle ↗ |
Preise = Richtwerte / Anbieter-Listenpreise, Stand Juli 2026. Abos haben Fair-Use-Limits statt fixer Token-Zahlen; Enterprise-Preise sind i. d. R. verhandelt. Ohne Gewähr.
Welcher Mix ist für Ihr Unternehmen am günstigsten?
Aivora analysiert Ihre reale Nutzung und findet die wirtschaftlichste Kombination aus API, Flat-Lizenzen und (EU-)Hosting – und setzt sie per Routing automatisch durch.
Assessment anfragen