GEKI.AI
← Alle Case Studies Case Study · KI-Dokumentenverarbeitung

Ein Dokumentenverarbeitungs-SaaS senkt seine KI-Rechnung um ~70 %.

Wechsel von einer Hyperscaler-API zu europäischen GPUs, gehostet und gemanagt von GEKI. Offenes Modell hinter einer OpenAI-kompatiblen API; ungenutzte Kapazität wird nachts verkauft.

~70%
Geringere Netto-KI-Kosten
EU
Tokens & Datenresidenz
~100%
Hardware-Auslastung
0
Eigenes GPU-Ops-Team

Die Herausforderung

1,5 Mio. Dokumente/Monat, 20.000 €/Monat für eine US-Hyperscaler-API. Ziel: planbare Kosten und weniger Abhängigkeit von einem Anbieter.

Der GEKI-Ansatz

Offenes Modell auf GPUs, die GEKI in der EU stellt und betreibt. OpenAI-kompatible API, kein Hardware-Kauf. Hyperscaler bleibt für Peaks und Fallback.

Das Ergebnis

Netto-KI-Kosten von 20.000 € auf ~6.000 €/Monat. Ungenutzte Kapazität wird nachts verkauft; Tokens laufen in der EU.

Weniger Abhängigkeit, niedrigere Rechnung

Eine SaaS-Plattform für Dokumentenverarbeitung zahlt 20.000 € pro Monat an einen US-Hyperscaler. Ziel: planbare Kosten, europäische Tokens, ohne GPU-Ops-Team.

GEKI verlagerte den Workload auf dedizierte GPUs im EU-Rechenzentrum — Infrastruktur und Betrieb durch GEKI, offenes Modell, OpenAI-kompatible API. Der Anwendungscode blieb unverändert.

Viel Volumen, eine API-Rechnung

Die Plattform verarbeitet rund 1,5 Millionen Dokumente pro Monat: Support-Gespräche zusammenfassen, strukturierte Daten extrahieren. Viel Input, JSON-Output — alles über eine Hyperscaler-KI-API.

Warum wechseln

  • Abhängigkeit: ein US-Anbieter für Modelle, Kapazität und Preise
  • Daten: Kundendaten und Inferenz sollen in der EU bleiben
  • Kosten: Die API-Rechnung wächst mit jedem Kunden und drückt die Marge
Aktueller WorkloadWert
Dokumente / Monat1.500.000
Ø Input / Output2.500 / 500 Tokens
Tokens pro Monat (in / out)4 Mrd. / 800 Mio.
Monatliche KI-Kosten (Hyperscaler)20.000 €

Offenes Modell, europäische GPUs, gemanagt von GEKI

1. Modell validieren. GEKI hat offene Modelle an echten Daten der Plattform gemessen. DeepSeek V4 Flash lag bei Zusammenfassung, Recall, Halluzinationen und JSON-Konformität auf oder über Produktionsniveau — und wurde gewählt.

2. Infrastruktur stellen & betreiben. Statt GPUs zu kaufen, stellt und betreibt GEKI die Kapazität in einem EU-Rechenzentrum. Kein Hardware-Kauf, kein Infrastruktur-Team. GEKI übernimmt Deployment, Monitoring, Sicherheit und Upgrades.

3. Code behalten. Das Modell läuft über eine OpenAI-kompatible API. Die Anwendung bleibt; es ändert sich nur der Endpoint.

  • Tokens auf EU-Infrastruktur
  • Offenes Modell, kein einzelner Anbieter als Flaschenhals
  • OpenAI-kompatible API — Endpoint austauschbar
  • Betrieb durch GEKI — kein GPU-Team beim Kunden

Kosten vorher und nachher

Der Workload passt auf die dedizierte Kapazität. Die Managed-Service-Gebühr (GEKI-Infrastruktur + Betrieb) ersetzt die variable API-Rechnung:

Vorher (Hyperscaler-API)Nachher (GEKI managed)
Monatliche KI-Kosten20.000 €~6.300 €
Idle-Kapazitätsverkauf (nachts)− Erlösanrechnung
Monatliche Nettokosten20.000 €~6.000 €

Ungenutzte Kapazität nachts verkauft

Dokumentenverarbeitung läuft vor allem tagsüber; nachts stünden die GPUs still. GEKI verkauft ungenutzte Kapazität als Tokens am Spotmarkt. Der Kunden-Workload hat Priorität; externer Traffic nur auf freier Kapazität. So kommt die Hardware auf nahezu 100 % Auslastung, der Erlös senkt die Service-Gebühr — Netto-Ersparnis ~70 %.

Hyperscaler bleibt für Peaks & Fallback

Die Hyperscaler-API bleibt als Peak- und Fallback-Pfad: bei Lastspitzen über der dedizierten Kapazität oder in der Wartung. Sie ist nicht mehr der Hauptlieferant — der Anbieter-Mix ist breiter, nicht nur getauscht.

Was sich geändert hat

  • Netto-KI-Kosten: 20.000 € → ~6.000 €/Monat (~70 % weniger)
  • Qualität mit validiertem offenem Modell gehalten
  • Tokens in der EU, Datenresidenz in der EU
  • Hyperscaler nur noch für Peaks & Fallback
  • Ungenutzte Kapazität verkauft; Hardware nahe ~100 % Auslastung
  • Kein GPU-Ops-Team beim Kunden
Ihr Workload

Ihr Setup als Nächstes?

Preise ansehen oder kurz beschreiben, was Sie betreiben — wir rechnen es durch.