DeepSeek V4 Flash: starke Agenten über die API, offen und auf zwei GPUs betreibbar. Warum das souveräne KI in Europa jetzt noch attraktiver macht.
Matthias Allitsch-Wutte · GEKI Gründer
31. Juli 2026 · 4 Min.
Ein leistungsfähiges Modell, das auf zwei GPUs läuft und offen ist: Das gab es bis vor Kurzem nicht. Souveräne KI kommt langsam an, getrieben von den Entwicklungen im Open-Source-Bereich, erst Kimi K3, jetzt DeepSeek V4 Flash.
DeepSeek hat am 31. Juli 2026 die API-Version von V4 Flash deutlich verbessert. Parallel dazu lässt sich die offene V4-Flash-Architektur bereits auf eigener Hardware betreiben, unter MIT-Lizenz. Das Modell ist auf Agenten ausgelegt, also auf KI, die eigenständig Aufgaben erledigt statt nur zu chatten. Die neuen Benchmark-Werte gelten für die DeepSeek-API (V4-Flash-0731); die offenen Weights sind weiterhin die Preview — gleiche Architektur, das Re-Post-Training als Weights noch nicht released.
Das Besondere ist die Kombination: starke Leistung bei Agenten-Aufgaben, offene Weights, und Hardware, die ein Unternehmen selbst kontrollieren kann. Entscheidend wird sein, wie weit sich die neuen, über die API gemessenen Werte auch auf eigener Hardware reproduzieren lassen.
Ein guter Maßstab ist GPT-5.6 Terra, OpenAIs starkes Mittelklasse-Modell für den wirtschaftlichen Unternehmenseinsatz. Die beiden Benchmarks messen, wie gut ein Modell echte Aufgaben löst — zum Beispiel im Terminal arbeiten oder Werkzeuge bedienen. Höher ist besser.
| Herstellerangaben (31. Juli 2026, DeepSeek-API) | DeepSeek V4 Flash | GPT-5.6 Terra |
|---|---|---|
| Terminal Bench 2.1 | 82,7 | 78,4 |
| Toolathlon Verified | 70,3 | 53,1 |
Quelle: DeepSeek-Release-Daten (nicht unabhängig reproduziert).
In diesen Hersteller-Testläufen liegt V4 Flash bei Agenten-Aufgaben über einem starken proprietären Mittelklasse-Modell, zu einem Bruchteil der Kosten. Für viele praktische Zwecke ist das durchaus vergleichbar — Terminal Bench spricht eine klare Sprache. (Selbst auf Hacker News, wo Modell-Releases sonst nüchtern gesehen werden, fiel der Satz: „This is more exciting than K3.”)
Vom Modell selbst (Angaben von DeepSeek):
Auf unserer eigenen Infrastruktur. Alle GEKI-Zahlen in diesem Artikel, Durchsatz wie Preise, sind auf GEKI-eigenen GPUs erhoben, in einem europäischen Rechenzentrum und mit dem GEKI-Software-Stack. Die Preview fahren wir intern schon intensiv in eigenen Agenten und Workflows — nicht nur als Demo.
Ein starkes offenes Modell ist die halbe Geschichte. Die andere Hälfte ist der Preis. Hier die effektiven Preise pro einer Million Tokens, gemischt im Verhältnis 8 Input : 1 Output — ein üblicher Schnitt für Agenten-Arbeit:
| Effektiv / 1 Mio. Tokens (8 In : 1 Out) | GPT-5.6 Terra (US-Hyperscaler, Beispiel) | GEKI Managed (DS V4 Flash) |
|---|---|---|
| Blended | ~$3,58 | ca. 0,20 € (≈ $0,23) |
Terra aus API-Listenpreisen (Input ~$2,30 / Output ~$13,80), umgerechnet auf 8:1. GEKI: Richtwert bei hoher Auslastung auf empfohlener Hardware, siehe Preise. Alle USD-Vergleiche zum Kurs vom 31. Juli 2026 (1 € = 1,15 $).
So ist die Tabelle zu lesen: GEKI verkauft keine Tokens einzeln, sondern eine Instanz inkl. Betrieb. Der effektive Preis pro Million Tokens ist ein Richtwert — je nach Auslastung oft noch günstiger. Gegenüber Terra liegt er rund eine Größenordnung darunter. Bei den Mengen, die Automatisierung verbraucht, entscheidet genau das über den Business Case.
Diese Benchmarks messen keine theoretischen Fähigkeiten. Sie messen reale Aufgaben: Software entwickeln, das Terminal bedienen, APIs verwenden, Tools steuern, Security-Workflows automatisieren.
Übersetzt heißt das: Agenten, die Aufgaben verlässlich lösen, zu Kosten, bei denen sich Automatisierung auch für den Mittelstand rechnet. Beispiele aus der Praxis:
Souveränität entsteht nicht durch den Herkunftsort eines Modells. Sie entsteht durch Kontrolle: über Daten, Infrastruktur, Modellversionen, Zugriffe und den laufenden Betrieb.
Konkret heißt das:
Ein offenes Modell wie V4 Flash ist die Voraussetzung dafür. Wirklich betreibbar wird das Ganze aber erst durch eine Betriebsschicht, die genau diese Kontrolle liefert. Genau da setzt GEKI an, nicht als reines On-Premise-Hosting, sondern als gemanagter, kontrollierbarer Betrieb.
GEKIs Einstiegskonfiguration auf 2× RTX PRO 6000, betrieben mit SLAs im passenden Rechenzentrum.