Hetzner, der deutsche Hosting-Anbieter, bekannt für aggressive Preise und eigene Rechenzentren, hat einen experimentellen Dienst für LLM-Inferenz (Large Language Model) gestartet, also das Ausführen von Sprachmodellen über eine API. Es handelt sich um eine frühe Testphase, nicht um ein fertiges Produkt, was das Unternehmen auch offen betont.
Was ist Hetzner Inference und wie funktioniert es?
Hetzner Inference ist eine API, die mit dem OpenAI-Standard kompatibel ist. Entwickler können sie daher genauso nutzen wie andere bekannte Inferenzdienste, nur mit einer anderen URL und einem anderen API-Schlüssel. Benutzer erstellen ein Token im experimentellen Dashboard, richten den OpenAI-Client auf den Hetzner-Server und das Modell ist einsatzbereit. Das Unternehmen hat außerdem eine kurze Anleitung veröffentlicht, wie das Tool OpenCode mit dieser API verbunden werden kann, für alle, die den Dienst ohne Programmierung testen möchten.
Welches Modell ist verfügbar und welche Eigenschaften hat es?
Das derzeit einzige verfügbare Modell ist Qwen/Qwen3.6-35B-A3B-FP8, ein chinesisches Open-Weight-Modell. Es handelt sich um eine Mixture-of-Experts (MoE)-Architektur mit insgesamt 35 Milliarden Parametern, von denen immer nur 3 Milliarden aktiv sind, was es effizienter macht. Das Modell akzeptiert Text und Bilder, hat ein Kontextfenster von 262.000 Token und die Gewichte sind zur Reduzierung des Speicherfußabdrucks im FP8-Format quantisiert.
Der unabhängige Tester Jonas, der die API am 23. Juli 2026 ausprobierte, verzeichnete eine mediane Time-to-First-Token von 153 Millisekunden bei bereits geöffneter Verbindung und eine Geschwindigkeit von 224 Ausgabe-Token pro Sekunde bei längeren Generierungen. Der Autor selbst weist darauf hin, dass dies die Ergebnisse eines einzelnen Clients zu einem bestimmten Zeitpunkt sind und nichts über das Systemverhalten unter Last vieler Benutzer aussagen.
Dies ist ein Experiment, kein Produkt
Hetzner ist bezüglich des Status des Dienstes deutlich. Laut den Informationen aus der Servicebeschreibung: "Dies ist sehr viel ein Experiment. Es gibt keine Abrechnung, keine SLA, keine Produktionsgarantie und derzeit nur ein Modell." Das Unternehmen möchte herausfinden, ob es eine echte Nachfrage nach einem solchen Dienst gibt, wie das System skaliert, welche Funktionen für Benutzer wichtig sind und wie viel Last es verträgt. Es gibt keine Abrechnung, keinen Service-Level-Agreement und keine Verfügbarkeitsgarantien.
Warum ist dies strategisch interessant?
Der Markt für die Inferenz offener Modelle wird zunehmend zur Commodity, da jeder dieselben Gewichte herunterladen und denselben Dienst betreiben kann. Das erschwert hohe Margen, es sei denn, der Anbieter hat einen klaren Vorteil. Hetzner ist dafür bekannt, Hardware in eigenen Rechenzentren selbst zu kaufen und zu betreiben, mit einer äußerst effizienten Kostenstruktur, was es theoretisch zu einem ernsthaften Kandidaten für den Niedrigpreis-Inferenzmarkt macht. Hinzu kommt das Argument der Kapazitätsauslastung: Während ein gemieteter dedizierter Server einem einzelnen Benutzer unabhängig von der Nutzung gehört, kann eine Inferenz-API die GPU-Kapazität auf mehrere Benutzer verteilen und so die Hardwareauslastung erhöhen.
Eine entscheidende offene Frage, so die Analyse des Autors, der den Dienst getestet hat, ist die Hardware. Das derzeit öffentliche Angebotsverzeichnis von Hetzner für GPU-Server umfasst Workstation-GPUs, die für kleinere und mittlere Modelle geeignet sind, aber nicht für sehr große Modelle, die mehrere High-End-GPUs mit schnellen Verbindungen untereinander erfordern. Der Autor stellt jedoch fest, dass die Hardware hinter der experimentellen API nicht unbedingt identisch mit der im öffentlichen Verzeichnis der dedizierten Server sein muss. Wenn Hetzner plant, das Angebot auf einen größeren Modellkatalog und leistungsstärkere Hardware auszuweiten, könnte der europäische Inferenzmarkt einen neuen ernsthaften Spieler mit dem Ruf aggressiver Preise und zuverlässiger Infrastruktur bekommen.