Home

Density is all you need: private KI auf dem Schreibtisch

Kleinere Sprachmodelle sind nicht der Schlüssel. Mehr Rechenleistung alleine auch nicht. Erst wenn Sprachmodelle auf Ihrem Laptop laufen können und genug Informationen enthalten, werden neue Anwendungen auf Ihrem Schreibtisch möglich.

25. Sept. 2026

Alle Beiträge ansehen
Qwen3.5-9B schlägt das 13-mal größere GPT-OSS-120B bei GPQA Diamond, MMLU-Pro, MMMLU und LongBench v2

Immer größere Frontier-Modelle bestimmen die KI-Schlagzeilen. Ich halte eine leisere Revolution für wichtiger: kleinere Modelle mit vergleichbaren Fähigkeiten, die auf unsere Laptops passen.

Dichte statt Effizienz

Technische Revolutionen schreiben wir gern Effizienzgewinnen zu. Ich glaube, es gibt eine aufschlussreichere Sichtweise.

Letztes Wochenende habe ich mit einem Akkuschrauber Hunderte Schrauben in und durch OSB-Platten gedreht. Erst als ich eine wieder herausdrehen musste, habe ich gemerkt, wie heiß sie war. Dabei wurde mir wieder bewusst, wie viel Kraft ich am Werkzeuggürtel trage. Bei kabelgebundenen Werkzeugen war Effizienz nie das Problem: Die Steckdose lieferte so viel Strom, wie man wollte. Die Kategorie der Akkuwerkzeuge entstand erst mit einem Akku, der leicht genug zum Tragen ist und trotzdem genug Energie speichert, und einem Motor, der leicht und stark genug ist, um daraus stundenlang und klaglos Drehmoment zu machen.

Effizienz — Nutzen im Verhältnis zum Aufwand — optimiert innerhalb eines bestehenden Anwendungsfalls: ein sparsamerer Motor, schlankerer Code. Dichte hingegen ist die Menge pro Einheit einer Größe, die für die Anwendung entscheidender ist: Masse, Volumen, Parameterzahl.

Schema: Effizienz verbessert sich schrittweise innerhalb eines Anwendungsfalls, während Dichte beim Überschreiten einer Schwelle eine neue Produktkategorie eröffnet.
Effizienz optimiert innerhalb eines Anwendungsfalls; Dichte, die eine Schwelle überschreitet, erlaubt neue Einsatzgebiete.

Leistungsdichte

Die Energiedichte von Akkus stieg von Nickel-Cadmium über Nickel-Metallhydrid zu Lithium-Ionen. Jeder Sprung machte Werkzeuge nicht billiger im Betrieb, sondern ermöglichte neue Werkzeugkategorien. Magnete aus seltenen Erden und engere Fertigungstoleranzen ermöglichten Elektromotoren für Handwerkzeuge und Drohnen. Die Entwicklung von der Dampfmaschine über den Turbodiesel zum kleinen Verbrennungsmotor erlaubte neue Anwendungen: von der Dampflok über den Pkw bis zur handlichen Kettensäge.

Spannweitendiagramm der spezifischen Energie in Wattstunden pro Kilogramm: Nickel-Cadmium 40–60, Nickel-Metallhydrid 46–120, Lithium-Ionen 160–300, mit den Werkzeugen, die jede Technologie ermöglichte
Spezifische Energie wiederaufladbarer Akkutechnologien, Wh/kg. Daten: englischsprachige Wikipedia, Artikel zu Nickel-Cadmium-, Nickel-Metallhydrid- und Lithium-Ionen-Akkus, September 2026.

Nichts davon entstand allein dadurch, das alte Design weiter auszureizen. Es brauchte weitere Hebel: Reineres Kupfer lässt Wicklungen mehr Strom führen; wärmebehandelter legierter Stahl überträgt mehr Drehmoment bei weniger Masse; und die moderne Massenfertigung, die auf die Nachfrage der neuen Kategorien setzte, drückte den Preis einstiger „Raumfahrttechnik" wie moderner Akkuzellen auf einen Bruchteil.

Dichte und Nutzen

Dichte verbessert sich kontinuierlich, genau wie Effizienz. Die Maßeinheiten für Dichte — Wattstunden pro Kilogramm, Watt pro Kilogramm — machen ihre Wirkung in der realen Welt leichter sichtbar als die Prozente der Effizienz. Was sich dagegen nicht kontinuierlich verbessert, ist der Nutzen: der Wert, den ein Produkt für den hat, der es verwendet, dort, wo er es verwendet. Dort passiert der Sprung:

Andreas Stihls erste Benzin-Motorsäge, der Typ A von 1929, wog 46 kg und musste von zwei Personen bedient werden. Seine BL von 1950 wog je nach Quelle 16 bis 19 kg und war die erste Benzin-Motorsäge von Stihl, die eine Person in den Wald tragen konnte. Das war die Revolution. Seitdem war der Fortschritt evolutionär: Die Contra von 1959 wog 12 kg, und die heutige MS 500i leistet 5 kW bei 6,2 kg. Die spezifische Leistung stieg stetig, von etwa 0,1 über 0,2 und 0,4 auf 0,8 kW/kg; der Nutzen sprang einmal.

Zweiteiliges Diagramm: Die spezifische Leistung von STIHL-Benzin-Motorsägen steigt stetig von 0,1 kW/kg (Typ A, 1929, 46 kg, zwei Personen) über 0,2 (BL, 1950, 16–19 kg, eine Person) und 0,4 (Contra, 1959, 12 kg) auf 0,8 (MS 500i, 2019, 6,2 kg). Elektrosägen sind als einzelne Punkte eingezeichnet: die erste STIHL-Säge von 1926 (mindestens 37 kg, 2,2 kW, mit Kabel), die kabelgebundene MSE 250 von 2014 und die Akku-Säge MSA 300 von 2022, beide bei rund 0,4 kW/kg. Eine illustrative Nutzenlinie darunter springt einmal, 1950, als eine Person die Säge tragen konnte
Spezifische Leistung von STIHL-Motorsägen in kW/kg, berechnet aus Gewicht und Leistung; Benzinsägen blau, Elektrosägen orange. Eingezeichnet sind die BL mit 16 kg (die Quellen nennen 16 bis 19 kg), die Säge von 1926 mit 37 kg („oder mehr") und die MSA 300 mit 7,3 kg inklusive Akku. Die Nutzenlinie ist illustrativ, keine Messung. Daten: STIHL-Produktgeschichte und Pressemitteilung zur Contra; Elektrosägen: STIHL-Blog (archiviert); Gewicht der BL: Fire and Saw.

Inzwischen schließt sich der Kreis. Andreas Stihls allererste Säge war elektrisch, hing am Kabel und war so schwer, dass zwei Personen sie bedienen mussten. Benzin setzte sich durch, weil nur ein Tank genug Energie in einem mobilen Paket speicherte, das eine Person tragen konnte. Heute können das auch Akkus: Stihl verkaufte 2010 seine erste Akku-Motorsäge, und die MSA 300 leistet 3 kW bei 7,2 bis 7,4 kg inklusive Akku und liegt damit etwa dort, wo Benzinsägen 1959 standen. Die Motorsäge wird zum Akkuwerkzeug, genau wie mein Akkuschrauber.

Der Nutzen hängt von der Aufgabe ab. Ohne Kabel zu arbeiten, bringt neben der Steckdose weniger als auf dem Dach oder dem Gerüst. Bei lokaler KI ist es genauso: Ein Modell auf Ihrem Laptop ist am meisten wert, wenn Ihre Daten sensibel sind und ohnehin dort liegen.

Informationsdichte

Ich glaube nicht, dass Dichte bei Werkstoffen aufhört. Information ist ein weiterer „Werkstoff", der verdichtet wird.

Denn Sprachmodelle werden nicht nur besser, sondern dichter. Alibabas Qwen3.5-9B, im März 2026 erschienen, schlägt OpenAIs GPT-OSS-120B, ein dreizehnmal größeres Modell, beim logischen Schließen (GPQA Diamond, 81,7 zu 80,1) und bei langen Kontexten (LongBench v2, 55,2 zu 48,2). Ein glatter Durchmarsch ist es nicht — beim Programmieren (LiveCodeBench v6, 82,7 zu 65,6) liegt GPT-OSS-120B immer noch klar vorn —, aber ein Modell, das auf einem Laptop läuft, kann inzwischen bei den meisten Aufgaben, die man einem Modell stellt, eines schlagen, das GPUs aus dem Rechenzentrum braucht.

Gruppiertes Balkendiagramm: Qwen3.5-9B und GPT-OSS-120B bei GPQA Diamond, MMLU-Pro, MMMLU, LongBench v2 und LiveCodeBench v6; das 9B-Modell gewinnt überall außer beim Programmieren
Benchmark-Werte, Qwen3.5-9B (9 Milliarden Parameter) vs. GPT-OSS-120B (120 Milliarden Parameter). Stand: 23. September 2026. Quelle: Qwen 3.5 Small Series Review 2026, ComputerTech, März 2026.

Die Hebel entsprechen Kupfer, Stahl oder verbesserter Fertigung: besser aufbereitete Trainingsdaten, bessere Architekturen, bessere Trainingsalgorithmen und, neben vielen weiteren Fortschritten, Kompression wie Quantisierung und Destillation.

Rechendichte

Chips sind die andere Hälfte. Steigende Transistordichte und Leistung pro Watt — die Erben des Mooreschen Gesetzes — lassen die NPUs und GPUs in gewöhnlichen Laptops und Smartphones leisten, wofür bis vor Kurzem ein Rechenzentrum nötig war. Zusammen mit den dichteren Sprachmodellen ist das ein Akkuschrauber-Moment der KI.

Dichte auf dem Schreibtisch

Warum also gehen wir immer noch davon aus, dass KI-Inferenz — und damit auch unsere Daten — ins Rechenzentrum eines anderen gehört, womöglich auf einem anderen Kontinent oder in einem Land mit fragwürdiger Rechtsordnung?

Viel alltägliche KI-Arbeit — Texte entwerfen, Hilfe beim Programmieren — braucht keinen Hyperscale-Cluster, sobald das Modell auf das Gerät vor uns passt. Textverarbeitung und Tabellenkalkulation sind denselben Weg vom Großrechner auf den Schreibtisch gegangen, und ich bin mir sicher, dass ein guter Teil der KI-Inferenz folgt. (Training ist etwas anderes: Es braucht enorme Ressourcen und bleibt im Rechenzentrum.)

Läuft die Inferenz auf Ihrem eigenen Gerät, müssen Sie sich keine Gedanken mehr darüber machen, wohin Ihre sensiblen Daten gehen — Compliance wirkt plötzlich weit weniger abschreckend —, und auch nicht darüber, wann Ihr nächstes Token-Limit eine Kaffeepause erzwingt oder ob Sie sich den Kaffee überhaupt noch leisten können.

Ein Beispiel ist Kind, die Desktop-KI-App von Synsira: Sie beantwortet Fragen zu Ihren eigenen Texten, Bildern und Videos, und ihre Local-Edition garantiert, dass Ihre Daten Ihren Mac oder Windows-PC nie verlassen.

Bei explai kappen wir das Kabel ebenfalls: Wir bauen eine Desktop-App, die Ihre Datenanalysen vollständig lokal ausführt. Bleiben Sie dran …

Density is all you need: private KI auf dem… | explai Blog