Die Geschichte von DeepSeek

DeepSeek · Quellenbelegte Chronik

Die Geschichte von DeepSeek

Vom Quant-Fonds High-Flyer über den „R1-Schock“ bis DeepSeek-V4-Pro — Modelle, Effizienz und Kontroversen.

Position · September 2026Frontier-Herausforderernah dran, erste Finanzierungsrunde abgeschlossen
Stand: 6. September 2026
0Ereignisse
2016–26zehn Jahre
0Modelle
0Quellen-Belege

Konfidenz-Kennzeichnung

  • Faktum (belegt)
  • 🟡 teilweise belegt
  • 🔵 Interpretation

Kategorien

  • Unternehmen
  • Forschung
  • Sicherheit
  • Modell
  • Produkt
  • Kontroverse
Interaktiv · in Kapiteln

Zeitleiste

Fünf Kapitel von High-Flyer bis DeepSeek-V4-Pro. Filtere nach Kategorie oder durchsuche alle Ereignisse — jeder Eintrag führt seine Quellen mit.

Ära 01 · 2016–2022

Die Vorgeschichte: High-Flyer

Vom KI-Quant-Fonds High-Flyer zu eigenen GPU-Clustern.

Unternehmenbelegt

Gründung des Quant-Fonds High-Flyer

Liang Wenfeng gründet mit Kommilitonen den KI-getriebenen Hedgefonds High-Flyer (幻方) in Hangzhou. Bis 2021 läuft der Handel vollständig über KI-Strategien; der Fonds verwaltet zeitweise rund 10 Mrd. USD.

Unternehmenbelegt

Fire-Flyer: eigene GPU-Supercomputer

High-Flyer baut eigene KI-Cluster auf: Fire-Flyer I (2020, 1.100 GPUs) und Fire-Flyer II (2021) mit rund 10.000 Nvidia-A100-GPUs — laut Liang allesamt erworben, bevor die USA Chip-Exportkontrollen verhängten. Diese Rechenbasis ermöglicht später alle DeepSeek-Trainingsläufe.

Ära 02 · 2023

Gründung & erste Modelle

DeepSeek wird eigenständig — Coder und die ersten Sprachmodelle.

Modellbelegt

DeepSeek Coder (erstes Open-Source-Modell)DeepSeek Coder

DeepSeeks erstes Modell erscheint quelloffen auf GitHub und richtet sich speziell an Code-Aufgaben — in mehreren Größen und unter freier Lizenz.

Ära 03 · 2024

Architektur-Durchbrüche & V3

MLA, der Preiskrieg und das effiziente Flaggschiff V3.

Modellbelegt

DeepSeek-V2 löst Chinas Preiskrieg ausDeepSeek-V2

DeepSeek-V2 (236B gesamt, 21B aktiv) führt Multi-head Latent Attention (MLA) und DeepSeekMoE ein und senkt Kosten drastisch. Der API-Preis liegt 90–95 % unter der Konkurrenz; Alibaba, Baidu und ByteDance senken daraufhin ihre Preise um bis zu 97 % — ein Preiskrieg in Chinas KI-Branche.

Modellbelegt

DeepSeek-V2.5DeepSeek-V2.5

V2.5 vereint Chat- und Coder-V2-Fähigkeiten in einem Modell, mit besserer Konversation und Code-Verarbeitung und stärkerer Ausrichtung an menschlichen Präferenzen.

Schlüsselmoment
Modellbelegt

Der stille Auslöser: Frontier-Leistung zu einem Bruchteil der üblichen Kosten.

DeepSeek-V3 — Frontier-Leistung zum Bruchteil der KostenDeepSeek-V3

Das 671B-MoE-Modell (37B aktiv, 14,8 Bio. Tokens) erreicht GPT-4o-/Claude-3.5-Niveau. Der Bericht weist nur ~5,576 Mio. USD reine GPU-Trainingskosten aus (Kritiker: Gesamtkosten viel höher). Die Effizienz wird zum Weckruf für die Branche.

Hintergrund

DeepSeek-V3 (671B MoE, 37B aktiv) erreichte das Niveau von GPT-4o und Claude 3.5 Sonnet, kostete laut Bericht aber nur ~5,576 Mio. USD reine GPU-Trainingszeit (2,79 Mio. H800-Stunden). Kritiker betonen, dass Gesamtkosten inklusive Forschung und Infrastruktur weit höher liegen. Dennoch verschob V3 die Wahrnehmung, was Spitzen-KI kosten muss.

Im Kapitel weiterlesen →
Ära 04 · 2025

Der R1-Schock & die Folgen

R1, das Börsenbeben, Verbote — und die Reife der Modellreihe.

Schlüsselmoment
Modellbelegt

Offen, günstig, auf o1-Niveau — das Modell, das den Westen aufschrecken ließ.

DeepSeek-R1 — offenes Reasoning-Modell (MIT)DeepSeek-R1

R1 erreicht laut DeepSeek das Niveau von OpenAI o1 bei Mathematik, Code und Logik — und wird mitsamt Gewichten unter MIT-Lizenz freigegeben. Die Variante R1-Zero zeigt erstmals großskaliges Reasoning aus reinem Reinforcement Learning (GRPO), dazu destillierte Modelle von 1,5B bis 70B.

Hintergrund

R1 erreichte bei Mathematik, Code und Logik OpenAI-o1-Niveau — und wurde mitsamt Gewichten unter MIT-Lizenz freigegeben. Die Variante R1-Zero zeigte, dass starkes Reasoning auch aus reinem Reinforcement Learning ohne Supervised Fine-Tuning entstehen kann. Innerhalb von Tagen stürmte die App weltweit an die Spitze der App-Stores.

Im Kapitel weiterlesen →
Modellbelegt

Janus-Pro — multimodale offene ModelleJanus-Pro

Zum Mondneujahr veröffentlicht DeepSeek die multimodalen Modelle Janus-Pro (1B/7B) und JanusFlow unter MIT-Lizenz; sie übertreffen auf Bild-Benchmarks DALL·E 3 und Stable Diffusion 3 Medium.

Produktbelegt

DeepSeek-App überholt ChatGPT (Platz 1)DeepSeek-R1

Die DeepSeek-App wird zur meistgeladenen Gratis-App im US-App-Store und verdrängt ChatGPT — in 52 Ländern auf Platz 1, ~16 Mio. Downloads in 18 Tagen.

Schlüsselmoment
Unternehmenbelegt

Ein Tag, an dem rund 589 Milliarden Dollar verdampften.

Nvidia verliert ~589 Mrd. USD an einem Tag

DeepSeeks Effizienz löst einen globalen Tech-Ausverkauf aus: Nvidia bricht ~17 % ein und verliert rund 589 Mrd. USD Marktwert — der größte Einzeltagesverlust der US-Börsengeschichte. Marc Andreessen nennt R1 „AIs Sputnik-Moment“.

Hintergrund

Am 27. Januar 2025 brach Nvidia um rund 17 % ein und verlor etwa 589 Mrd. USD Marktwert — der größte Einzeltagesverlust der US-Börsengeschichte. Anleger fragten, ob teure KI-Chips im bisherigen Umfang noch nötig seien. Marc Andreessen prägte den Vergleich vom „Sputnik-Moment“ der KI.

Im Kapitel weiterlesen →
Kontroversebelegt

Distillations-Vorwurf von OpenAI/MicrosoftDeepSeek-R1

Microsoft und OpenAI untersuchen, ob mit DeepSeek verbundene Akteure per „Distillation“ in großem Umfang OpenAI-API-Ausgaben abgegriffen haben, um eigene Modelle zu trainieren.

Sicherheitbelegt

Offene Datenbank: Chatverläufe & Schlüssel exponiert

Wiz Research entdeckt eine öffentlich erreichbare DeepSeek-Datenbank ohne Authentifizierung mit über 1 Mio. Log-Einträgen — inklusive Klartext-Chats und API-Schlüsseln. DeepSeek sichert sie nach der Meldung.

Sicherheitbelegt

Italien sperrt DeepSeek (erstes Land)

Die Datenschutzbehörde Garante ordnet die sofortige Sperrung an, nachdem DeepSeek auf Fragen zu Datenpraktiken und Speicherung in China „unzureichend“ antwortete — das erste Notfall-DSGVO-Verbot gegen einen KI-Chatbot.

Schlüsselmoment
Kontroversebelegt

Brillante Technik trifft auf die roten Linien der chinesischen Politik.

Zensur politisch sensibler ThemenDeepSeek-R1

Recherchen zeigen: Die DeepSeek-App verweigert rund 85 % der Fragen zu sensiblen Themen (Tiananmen, Taiwan, Xi, Uiguren) oder löscht begonnene Antworten in Echtzeit — entlang chinesischer Vorgaben.

Hintergrund

Untersuchungen zeigten, dass die DeepSeek-App rund 85 % der Fragen zu sensiblen Themen wie dem Tiananmen-Massaker, Taiwan oder Xi Jinping verweigerte — teils, indem sie begonnene Antworten in Echtzeit wieder löschte. Taiwan wurde als „unveräußerlicher Teil Chinas“ dargestellt. Die Filter folgen chinesischen Vorgaben und gelten vielen als Preis der staatlichen Einbettung.

Im Kapitel weiterlesen →
Sicherheitbelegt

Taiwan, Australien & Südkorea verbieten DeepSeek

Taiwan untersagt den Behördeneinsatz (31.1.), Australien verbietet die App auf Regierungsgeräten (4.2.), Südkorea entfernt sie aus den App-Stores (15.2.) — wegen Datenschutz- und Sicherheitsbedenken.

Unternehmenbelegt

Liang Wenfeng beim Xi-Symposium

Liang nimmt an Xi Jinpings Symposium mit Privatunternehmern teil — neben Jack Ma und Ren Zhengfei. Die Einladung gilt als implizite staatliche Anerkennung DeepSeeks.

Modellbelegt

DeepSeek-R1-0528 (Reasoning-Update)DeepSeek-R1-0528

Das R1-Update verdoppelt die Denk-Tiefe (mehr Reasoning-Tokens), hebt AIME-2025 von 70 % auf 87,5 % und senkt Halluzinationen deutlich; neu sind JSON-Output und Function Calling.

Modellbelegt

DeepSeek-V3.1 (hybrides Reasoning)DeepSeek-V3.1

V3.1 (671B, 128K Kontext) lässt sich per Vorlage zwischen Thinking-Modus (Chain-of-Thought wie R1) und Non-Thinking-Modus (direkt wie V3) umschalten; Gewichte unter MIT.

Schlüsselmoment
Forschungbelegt

Erstmals besteht ein großes offenes Modell ein wissenschaftliches Peer-Review.

DeepSeek-R1 auf dem Nature-CoverDeepSeek-R1

R1 wird in Nature publiziert — das erste große Open-Weight-Modell, das ein Peer-Review durchläuft. Offengelegt: die reinen R1-Reasoning-Trainingskosten von 294.000 USD (512 H800, ~80 Std.) auf Basis des ~6-Mio.-USD-V3.

Hintergrund

Im September 2025 erschien R1 in Nature — das erste große Open-Weight-Modell, das ein unabhängiges Peer-Review durchlief (acht Gutachter, 64 Seiten). Offengelegt wurden u. a. die reinen Reasoning-Trainingskosten von 294.000 USD (512 H800-GPUs, ~80 Stunden), aufbauend auf dem rund 6 Mio. USD teuren Basismodell V3.

Im Kapitel weiterlesen →
Modellbelegt

DeepSeek-V3.1-TerminusDeepSeek-V3.1-Terminus

Eine produktionsreife Endstufe der V3.1-Reihe: behebt Sprachmisch-Fehler, verbessert mehrsprachige Konsistenz sowie Code- und Such-Agenten.

Modellbelegt

DeepSeek-V3.2-Exp halbiert die API-PreiseDeepSeek-V3.2-Exp

Mit „DeepSeek Sparse Attention“ (Lightning Indexer + feinkörnige Token-Auswahl) sinken die API-Preise um ~50 % (unter 3 Cent je Mio. Input-Token), bei vergleichbarer Benchmark-Leistung; Gewichte unter MIT.

Ära 05 · 2026

V4 & Etablierung

V4 wird offiziell: Flash-0731, Pro-0813, Vision-Exp — und die erste Finanzierungsrunde ist abgeschlossen.

Schlüsselmoment
Modellbelegt

Das offene Flaggschiff von 2026 — 1-Mio.-Kontext, zum Spottpreis.

DeepSeek-V4-Preview (1-Mio.-Kontext, Open Source)DeepSeek-V4

V4 erscheint in zwei offenen Varianten: V4-Pro (1,6 Bio. Parameter, 49B aktiv) und V4-Flash (284B, 13B aktiv), beide mit 1-Mio.-Token-Kontext und MIT-Lizenz; Sparse Attention senkt den Inferenzaufwand weiter. MIT Tech Review wertet es als Erfolg auch für Chinas Chip-Industrie.

Hintergrund

DeepSeek-V4 erschien als offene Preview in zwei Varianten — V4-Pro (1,6 Bio. Parameter, 49B aktiv) und V4-Flash (284B, 13B aktiv) — beide mit 1-Mio.-Token-Kontext unter MIT-Lizenz. Verbesserte Sparse Attention senkte den Inferenzaufwand weiter. MIT Technology Review wertete den Schritt auch als Erfolg für Chinas heimische Chip-Industrie.

Im Kapitel weiterlesen →
Unternehmenbelegt

Erste Finanzierungsrunde: ~45 Mrd. USD Bewertung

DeepSeek sucht erstmals externes Kapital bei einer Bewertung von rund 45 Mrd. USD; Chinas staatlicher „Big Fund“ soll die Runde anführen, Tencent und Alibaba sind in Gesprächen. Liang Wenfeng hält bislang knapp 90 %.

Schlüsselmoment
Unternehmenbelegt

Erstmals externes Geld — über 7 Mrd. USD, und Liang Wenfeng bleibt Herr im Haus.

Erste Finanzierungsrunde abgeschlossen: >50 Mrd. USD Bewertung

Nach Reuters-Bericht vom 3. Juni schließt DeepSeek seine erste externe Runde ab: rund 50 Mrd. Yuan (~7,4 Mrd. USD) bei 350–400 Mrd. Yuan post-money (~52–59 Mrd. USD). Tencent (~10 Mrd. Yuan) und CATL (~5 Mrd. Yuan) steigen ein, Liang Wenfeng schießt ~20 Mrd. Yuan eigenes Geld zu.

Hintergrund

The Information meldete Mitte Juni den Abschluss: mehr als 50 Mrd. Yuan bei einer Bewertung über 50 Mrd. USD. Ungewöhnlich ist die Struktur: Die Investoren stecken ihr Geld in eine von Liang Wenfeng verwaltete Limited Partnership statt direkt in DeepSeek — Tencent, CATL, JD.com und NetEase erhielten den Berichten zufolge keine Stimmrechte, Liang hält rund 84 %. Einziger externer Gesellschafter mit Governance-Rechten ist der staatliche National AI Industry Investment Fund. DeepSeek selbst hat die Runde bis heute nicht offiziell bestätigt.

Im Kapitel weiterlesen →
Modellbelegt

Aus der Preview wird der offizielle Dienst — mit Peak-Preisen zur Pekinger Rushhour.

V4 verlässt die Preview — alte Aliase abgeschaltet

Mitte Juli wird V4 offiziell: Das Preview-Label fällt, dafür kommen Peak-/Off-Peak-Preise (zur Pekinger Lastspitze 9–12 und 14–18 Uhr das Doppelte). Am 24. Juli werden die Legacy-Aliase „deepseek-chat“ und „deepseek-reasoner“ abgeschaltet — die API läuft komplett auf V4-Pro und V4-Flash.

Hintergrund

Die Peak-/Off-Peak-Logik ist typisch DeepSeek: Wer außerhalb der chinesischen Lastspitze inferiert, zahlt die Hälfte — ein Anreiz, der Rechenkapazität glättet und die Preisführerschaft am unteren Ende zementiert. Mit der Alias-Abschaltung endet auch die V2.5/V3-Ära in der API; Bestandskunden mussten auf die V4-Modellnamen migrieren.

Im Kapitel weiterlesen →
Modellbelegt

Der 284B-Flash wird zum Agenten-Arbeitstier — offene Gewichte am selben Tag.

V4-Flash-0731: Agenten- und Coding-SchubDeepSeek-V4-Flash

DeepSeek veröffentlicht den Checkpoint V4-Flash-0731 als offizielles Release in Public Beta — die Gewichte erscheinen am selben Tag auf Hugging Face. Deutliche Zuwächse bei agentischen und Coding-Aufgaben (Terminal-Bench 82,7 %), der Preis bleibt bei $0,14/$0,28 pro Mio. Token.

Hintergrund

Der 0731-Checkpoint ersetzt die April-Preview als offizielles V4-Flash: gleiche Architektur (284B MoE, 13B aktiv, MIT), aber agentisch nachgeschärft. Zu $0,14/$0,28 pro Mio. Token liegt der Flash damit um Größenordnungen unter westlichen Frontier-Preisen — in der KI-Modelle-Übersicht steht er beim Artificial-Analysis-Index bei 52.

Im Kapitel weiterlesen →
Modellbelegt

Das 1,6-Bio.-Parameter-Flaggschiff ist fertig — vier Monate nach der Preview.

V4-Pro erreicht GA (Checkpoint 0813)DeepSeek-V4-Pro

V4-Pro geht mit dem Checkpoint DeepSeek-V4-Pro-0813 in General Availability — das Flaggschiff mit 1,6 Bio. Parametern (49B aktiv) und 1-Mio.-Kontext ist damit produktiv verfügbar. Ab 16. August gelten Peak-Preise von $1,32/$3,96 pro Mio. Token, außerhalb der Lastspitze die Hälfte.

Hintergrund

Der API-Name „deepseek-v4-pro“ routet seit jeher auf den neuesten Checkpoint — mit 0813 endet die Preview-Phase auch beim Pro. In der KI-Modelle-Übersicht steht V4-Pro 0813 beim Artificial-Analysis-Index bei 53, knapp über dem Flash 0731 (52) — solide Frontier-Nähe, aber hinter den westlichen Spitzenmodellen der Saison (Fable 5.1, GPT-6 Astra).

Im Kapitel weiterlesen →
Modellbelegt

Erstmals multimodal: Der günstige Flash lernt sehen — Gewichte zehn Tage später offen.

V4-Flash-Vision-Exp: Der Flash bekommt AugenV4-Flash-Vision-Exp

Am 21. August erscheint mit „deepseek-v4-flash-vision-exp“ erstmals ein multimodales V4-Modell in der API — experimentell, aber zum selben Preis wie V4-Flash. Am 31. August folgen die Gewichte auf Hugging Face, wieder unter MIT-Lizenz.

Hintergrund

Vision-Exp baut auf V4-Flash und behält dessen Textleistung, ergänzt aber Bildverständnis — relevant für Agenten, die Screenshots ihrer Werkzeuge direkt zurück ins Modell schleifen. Praktischer Pfeiler: Bilder werden mit maximal 384 Token veranschlagt. Das „Exp“-Label signalisiert, dass DeepSeek das Modell selbst nicht als produktionsreif einstuft; in der KI-Modelle-Übersicht steht es beim AA-Index bei 51.

Im Kapitel weiterlesen →
Unternehmenteilw. belegt

Aus dem Nebenprojekt wird ein Geschäft — und die Hardware-Abhängigkeit soll fallen.

~500 Mio. USD Umsatz annualisiert — 2027-IPO und eigener Chip berichtet

Sekundärberichte (auf Reuters gestützt) beziffern DeepSeeks annualisierte Einnahmen auf knapp 500 Mio. USD bei berichteten 70–80 % Bruttomargen; ein IPO 2027 sei in Planung, zugleich stellt DeepSeek Chip-Designer für einen eigenen Inferenz-Chip ein. Das seit Langem erwartete R2 ist Stand September weiter nicht erschienen.

Hintergrund

Alle drei Angaben beruhen auf Presseberichten, nicht auf Unternehmensmitteilungen: die Umsatzzahl (~500 Mio. USD annualisiert) und die 2027-IPO-Pläne auf Reuters-basierten Sekundärquellen, die Chip-Pläne auf Stellenanzeigen für Chip-Design-Ingenieure — gelesen als Versuch, die Abhängigkeit von exportkontrollierter Nvidia-Hardware zu verringern. Und R2? Stand September 2026 hat DeepSeek kein R2 veröffentlicht und keinen Termin genannt; die Modelllinie läuft über V4 weiter.

Im Kapitel weiterlesen →
Keine Ereignisse für diese Auswahl.
Ausführliche Chronik
Tiefer einsteigen

Sieben Teile mit Quellenkritik, Datierung und Einordnung — auf einer eigenen, ruhigen Leseseite.

Zur ausführlichen Chronik →
Die Geschichte von DeepSeek — quellenbelegte Chronik, Stand 6. September 2026.
Inhaltlicher Anspruch: Fakten werden belegt, Unsicherheit benannt, Faktum von Deutung getrennt.