AivoraAssessment anfragen
Kostenloser Service

KI-Kostenmodelle

Man kann KI sehr unterschiedlich beziehen – pro Token über die API, als Flat-Abo (z. B. Claude Max), pro Sitz im Team, als Enterprise-Vertrag, selbst gehostet auf eigener GPU oder EU-souverän. Diese Sicht ordnet die Optionen ein und zeigt, wann sich welche lohnt.

Bezugswege

35

Kategorien

7

Anbieter

17

Hinweis: Abo-Preise und -Limits sind Richtwerte. Flat-Abos (Pro/Max u. Ä.) haben rollierende Fair-Use-Limits statt fixer Token-Zahlen, Enterprise-Preise sind i. d. R. verhandelt, und GPU-/Token-Preise schwanken. Maßgeblich sind die verlinkten Anbieter-Quellen (Spalte „Quelle“), Stand Juli 2026.

Wann lohnt sich was?

  • Variable / geringe Last → API (Pay-per-Token). Mit Batch (−50 %) und Prompt-Caching (~−90 %) am wirtschaftlichsten, wenn man nur echten Verbrauch zahlen will.
  • Intensive interaktive Nutzung → Flat-Abo. Faustregel: Wer täglich mehrere Stunden Claude Code/Agents nutzt (grob > 200 Mio. Tokens/Monat), fährt mit Max 20× ($200 flat) deutlich günstiger als pro Token.
  • Hohe, gleichmäßige Auslastung → eigene GPU. Eine H100 rund um die Uhr kostet ~$1.400–1.500/Monat (Neocloud); lohnt erst ab ~50–70 % Dauerauslastung. Darunter ist Serverless (offene Modelle) meist günstiger und einfacher.
  • Datenhoheit / Compliance → EU-souverän (STACKIT, IONOS, OVHcloud, T-Systems, Aleph Alpha). Oft teurer pro Token, aber bei DSGVO/kritischer Infrastruktur ausschlaggebend.

Abo oder API? – Schnellrechner

Geschätzten monatlichen API-Verbrauch eingeben – wir zeigen, ab wann sich eine Flat-Lizenz lohnt (Annahme: interaktive Nutzung, z. B. Coding).

API-Kosten / Monat

$140.00

Anthropic Claude Sonnet 5

Empfehlung

Claude Pro

ab ~$20 API-Wert (interaktiv)

OptionFixpreisLohnt ab
Pay-per-Token (API)immer
Claude Pro$20 / Monat~$20.00 API-Wert
Claude Max 5×$100 / Monat~$200.00 API-Wert
Claude Max 20×$200 / Monat~$300.00 API-Wert

Grobe Orientierung. Flat-Abos (Pro/Max) haben rollierende Fair-Use-Limits statt fixer Token-Zahlen und decken interaktives Arbeiten – nicht beliebige Produktions-API-Last. Bei stark schwankender oder automatisierter Last bleibt die API mit Batch- und Caching-Rabatten oft wirtschaftlicher.

API / Pay-per-Token

Nutzungsbasiert – zahlt nur echten Verbrauch. Ideal bei variabler Last und Integrationen.

Anbieter / PlanPreisEnthaltenFür wenHinweisQuelle
Anthropic
API / Pay-per-Token
nutzungsbasiertOpus 4.8 $5/$25, Sonnet 5 $3/$15, Haiku 4.5 $1/$5 je 1M TokensEntwickler, produktive Integrationen, variable LastBatch −50 %, Prompt-Caching Read ~0,1× / Write 1,25–2×Quelle ↗
Google
Gemini API
nutzungsbasiertGemini 3.1 Pro $2/$12 (>200K: $4/$18); 3.5 Flash $1,50/$9Entwickler/IntegrationenAI Studio gratis zum Testen; Batch −50 %Quelle ↗
Mistral
La Plateforme API
nutzungsbasiertMistral Large $2/$6 je 1M TokensEntwickler (EU-Anbieter)Batch −50 %, Cached Input −90 %Quelle ↗
OpenAI
API / Pay-per-Token
nutzungsbasiertGPT-5.x ~$1,25 In / ~$10 Out je 1M Tokens (modellabhängig)Entwickler, IntegrationenBatch/Flex −50 %, Cached Input ~−90 %, Prepaid-CreditsQuelle ↗
xAI
Grok API
nutzungsbasiertGrok 4.5 $2/$6 (Cache $0,50); Grok 4.3 $1,25/$2,50Entwickler75 % Cache-RabattQuelle ↗

Consumer-Abos (Flat)

Fixpreis pro Monat mit Fair-Use-Limits. Lohnt bei intensiver interaktiver Nutzung (Chat, Coding).

Anbieter / PlanPreisEnthaltenFür wenHinweisQuelle
Anthropic
Claude Max 20×
$200 / Monat~20× Pro (Richtwert ~220k Tokens / 5h-Fenster)Heavy Claude-Code-NutzerReale Nutzung oft $600–1.500/Monat API-Wert; non-interaktiv (CI/Agent SDK) aus separatem BudgetQuelle ↗
Anthropic
Claude Max 5×
$100 / Monat5× Pro-Nutzung, höhere Output-Limits, Priority, Early AccessIntensive Einzelnutzer, tägliches CodingEntspricht grob $200–500/Monat API-WertQuelle ↗
Anthropic
Claude Pro
$20 / Monat~1× Basisbudget (Richtwert ~44k Tokens / 5h-Fenster), Claude Code, ResearchEinzelne Power-User, moderates CodingNach Limit optional Usage-Credits zu API-RatenQuelle ↗
Google
Google AI Pro
$19,99 / Monat4× Nutzung vs. Free, voller Gemini 3.1 Pro, Deep Search, 5 TBPower-User/KreativeGemini in Gmail/DocsQuelle ↗
Google
Google AI Ultra
$99,99–199,99 / Monat5×–20× vs. Pro, Deep Think, bis 25.000 Flow-Credits, 20+ TBHöchstbedarf/ProfisEinstieg von $249,99 gesenktQuelle ↗
Mistral
Le Chat Pro
$14,99 / MonatHöhere Limits, ganztägiges Coding (CLI/IDE/Web), mehr BilderEinzel-Power-User (EU)Education $5,99/MonatQuelle ↗
OpenAI
ChatGPT Plus
$20 / MonatGPT-5.5, ~160 Nachrichten / 3h, Voice, BildgenStandard-Power-UserFair-Use-Limits je ModellQuelle ↗
OpenAI
ChatGPT Pro
$200 / Monat"Effektiv unbegrenzt" GPT-5.5 inkl. Reasoning, unbegrenzte BilderHeavy-User, Reasoning-intensivUnter Fair-Use / Abuse-GuardrailsQuelle ↗
Perplexity
Perplexity Pro
$20 / MonatUnbegrenzte Pro-Suche, 20 Deep-Research/Tag, GPT-5 & Claude OpusRecherche-Power-UserMax $200/Monat mit Labs/ComputerQuelle ↗
xAI
SuperGrok
$30 / MonatHöhere Rate-Limits, voller Grok-ZugangPower-UserSuperGrok Heavy $300/Monat für vollen Grok 4.5Quelle ↗

Team / pro Sitz

Pro Nutzer und Monat, mit Admin, SSO und Governance. Für Teams.

Anbieter / PlanPreisEnthaltenFür wenHinweisQuelle
Anthropic
Claude Team
$25 / Nutzer / MonatHöhere Nutzung als Pro, SSO, Admin, kein Training auf InhaltenKleine/mittlere TeamsMin. 5 Sitze; Premium-Seat $125 (5× Nutzung)Quelle ↗
Mistral
Le Chat Team
$24,99 / Nutzer / Monat30 GB/Nutzer, Domain-Verifizierung, alle Pro-FeaturesTeams (EU)Min. $50/MonatQuelle ↗
OpenAI
ChatGPT Business
$25 / Nutzer / MonatHöhere Limits, Workspace, Admin, kein Training auf DatenTeams/KMUMin. 2 SitzeQuelle ↗
Perplexity
Enterprise Pro
$40 / Sitz / Monat400 Pro-Suchen/Woche, SSO, SCIM, DatenisolierungTeams/UnternehmenRabatte ab 250+ NutzernQuelle ↗
xAI
Grok Business
$30 / Sitz / MonatSOC 2 Type II, RBAC, kein Training auf KundendatenKMU/TeamsSelf-ServeQuelle ↗

Enterprise

Verhandelte Verträge mit Compliance, SCIM, Audit-Logs, Custom Retention.

Anbieter / PlanPreisEnthaltenFür wenHinweisQuelle
Anthropic
Enterprise
ab $20 / Seat + API-Usage / CustomSCIM, Audit-Logs, RBAC, Compliance-API, Custom Retention, HIPAA-readyOrgs mit Compliance-BedarfSelf-Serve oder SalesQuelle ↗
Google
Gemini Enterprise
~$23–30 / Nutzer / Monat / CustomMax. Kontingente, DLP, Identity PremiumGroße OrganisationenSeparates Cloud-Produkt seit Okt. 2025Quelle ↗
Mistral
Le Chat Enterprise
Custom (Kontakt Sales)Custom Models, Agents, Audit-Logs, SAML SSO, Private DeploymentUnternehmen (EU)Drittquellen ~ab $20k/Monat (inoffiziell)Quelle ↗
OpenAI
Enterprise
Custom / Contact SalesErweiterte Kontexte, SSO/SCIM, Analytics, Compliance, SupportGroße UnternehmenKein öffentlicher ListenpreisQuelle ↗

Self-Hosting (eigene GPU)

Dedizierte GPU mieten und offene Modelle selbst betreiben. Lohnt bei hoher, gleichmäßiger Auslastung.

Anbieter / PlanPreisEnthaltenFür wenHinweisQuelle
Hyperscaler (AWS/Azure/GCP)
H100-Instanzen
~$3–7 / GPU-StundeGCP ~$3/h am günstigsten; Azure ~$7/h; Spot/Reserved −25–30 %Bestehende Cloud-StacksHyperscaler-Aufschlag ggü. NeocloudsQuelle ↗
Lambda
On-Demand GPU (H100)
~$2,49 / GPU-StundeVorkonfigurierte ML-Umgebung; H200 ~$4,49/hDev-freundlich, Training"just works"Quelle ↗
RunPod
On-Demand GPU (H100)
~$1,99 / GPU-StundeReine GPU – Modell selbst deployen; H100 24/7 ≈ $1.400–1.500/MonatGünstigstes Self-Hosting, SpikesNeocloud; A100 ~$1,19–1,39/h, L40S ~$0,79/hQuelle ↗

Serverless (Open-Weights)

Offene Modelle als API bei Dritt-Hostern – oft deutlich günstiger pro Token.

Anbieter / PlanPreisEnthaltenFür wenHinweisQuelle
DeepInfra
Serverless Open-Weights
ab ~$0,05 / 1M TokensLlama 3.3 70B $0,23/$0,40, 8B $0,05/$0,08Günstigste Token-Option für offene ModelleOft 3–4× günstiger als Together/FireworksQuelle ↗
Groq
On-Demand (LPU)
Llama 70B $0,59/$0,79 / 1M500+ Tokens/s, sehr schnellLatenz-kritische AppsEigene LPU-Chips; Batch/Cache −50 %Quelle ↗
Together AI
Serverless
Llama 70B ~$0,88 / 1MBreiter Modellkatalog, Fine-Tuning/DedicatedPrototyping, ModellvielfaltAuch dedizierte EndpunkteQuelle ↗

EU-souverän

Datenhoheit in der EU (DE/FR). Preis oft über US-Anbietern, aber entscheidend für Compliance.

Anbieter / PlanPreisEnthaltenFür wenHinweisQuelle
Aleph Alpha
PhariaAI (Enterprise)
Enterprise / Custom (Contact Sales)On-Prem/Sovereign-Plattform, Governance/RAGBehörden, kritische Infrastruktur, On-PremCohere-Merger 04/2026; "Command-Pharia 1" für Q4/2026 angekündigtQuelle ↗
IONOS
AI Model Hub
ab ~$0,17 / 1M TokensOpen-Weights, OpenAI-kompatibel, EU-RechenzentrenGünstige EU-SouveränitätDeutscher AnbieterQuelle ↗
OVHcloud
AI Endpoints
$0,05–1,01 In / $0,11–4,25 Out pro 1M40+ Open-Source-Modelle, FR-Hosting (Gravelines)Serverloses EU-HostingLlama/Mistral/QwenQuelle ↗
STACKIT (Schwarz-Gruppe)
AI Model Serving
~0,45 € / 0,65 € pro 1M TokensOpen-Weights, DE-Hosting, volle Datensouveränität; Embedding 0,02 €/1MSouveräne DE-WorkloadsDeutsche CloudQuelle ↗
T-Systems
AI Foundation Services
~0,20 € / 0,65 € pro 1M + Mindestumsatz30+ LLMs, OpenAI-kompatibel, DE/CH-HostingRegulierte Branchen, DSGVODedicated = feste HW-MieteQuelle ↗

Preise = Richtwerte / Anbieter-Listenpreise, Stand Juli 2026. Abos haben Fair-Use-Limits statt fixer Token-Zahlen; Enterprise-Preise sind i. d. R. verhandelt. Ohne Gewähr.

Welcher Mix ist für Ihr Unternehmen am günstigsten?

Aivora analysiert Ihre reale Nutzung und findet die wirtschaftlichste Kombination aus API, Flat-Lizenzen und (EU-)Hosting – und setzt sie per Routing automatisch durch.

Assessment anfragen