HR EN DE
NEWS SPORT BIZNIS SCENA LIFESTYLE TECH

Hetzner testet eigenen LLM-Dienst: Schnelle API, aber ohne Garantien

Der europäische Hosting-Riese hat einen experimentellen Dienst zum Ausführen von Sprachmodellen auf eigener Infrastruktur gestartet. Derzeit ist nur ein Modell verfügbar, es gibt keine Abrechnung und keine Garantien.

Foto: Wikipedia (Qwen)
Kurz gesagt
  • Hetzner hat einen experimentellen Dienst für LLM-Inferenz mit einer OpenAI-kompatiblen API auf eigener Infrastruktur gestartet.
  • Das einzige verfügbare Modell ist Qwen/Qwen3.6-35B-A3B-FP8 mit 35 Milliarden Parametern und einem Kontextfenster von 262.000 Token.
  • Der Dienst ist kostenlos, jedoch ohne SLA, Garantien oder Support für den Produktionseinsatz.
  • Die entscheidende Frage ist, ob Hetzner in leistungsstärkere GPU-Hardware investiert, die einen breiteren Modellkatalog und eine ernsthaftere Marktposition ermöglicht.

Hetzner, der deutsche Hosting-Anbieter, bekannt für aggressive Preise und eigene Rechenzentren, hat einen experimentellen Dienst für LLM-Inferenz (Large Language Model) gestartet, also das Ausführen von Sprachmodellen über eine API. Es handelt sich um eine frühe Testphase, nicht um ein fertiges Produkt, was das Unternehmen auch offen betont.

Was ist Hetzner Inference und wie funktioniert es?

Hetzner Inference ist eine API, die mit dem OpenAI-Standard kompatibel ist. Entwickler können sie daher genauso nutzen wie andere bekannte Inferenzdienste, nur mit einer anderen URL und einem anderen API-Schlüssel. Benutzer erstellen ein Token im experimentellen Dashboard, richten den OpenAI-Client auf den Hetzner-Server und das Modell ist einsatzbereit. Das Unternehmen hat außerdem eine kurze Anleitung veröffentlicht, wie das Tool OpenCode mit dieser API verbunden werden kann, für alle, die den Dienst ohne Programmierung testen möchten.

Welches Modell ist verfügbar und welche Eigenschaften hat es?

Das derzeit einzige verfügbare Modell ist Qwen/Qwen3.6-35B-A3B-FP8, ein chinesisches Open-Weight-Modell. Es handelt sich um eine Mixture-of-Experts (MoE)-Architektur mit insgesamt 35 Milliarden Parametern, von denen immer nur 3 Milliarden aktiv sind, was es effizienter macht. Das Modell akzeptiert Text und Bilder, hat ein Kontextfenster von 262.000 Token und die Gewichte sind zur Reduzierung des Speicherfußabdrucks im FP8-Format quantisiert.

Der unabhängige Tester Jonas, der die API am 23. Juli 2026 ausprobierte, verzeichnete eine mediane Time-to-First-Token von 153 Millisekunden bei bereits geöffneter Verbindung und eine Geschwindigkeit von 224 Ausgabe-Token pro Sekunde bei längeren Generierungen. Der Autor selbst weist darauf hin, dass dies die Ergebnisse eines einzelnen Clients zu einem bestimmten Zeitpunkt sind und nichts über das Systemverhalten unter Last vieler Benutzer aussagen.

Dies ist ein Experiment, kein Produkt

Hetzner ist bezüglich des Status des Dienstes deutlich. Laut den Informationen aus der Servicebeschreibung: "Dies ist sehr viel ein Experiment. Es gibt keine Abrechnung, keine SLA, keine Produktionsgarantie und derzeit nur ein Modell." Das Unternehmen möchte herausfinden, ob es eine echte Nachfrage nach einem solchen Dienst gibt, wie das System skaliert, welche Funktionen für Benutzer wichtig sind und wie viel Last es verträgt. Es gibt keine Abrechnung, keinen Service-Level-Agreement und keine Verfügbarkeitsgarantien.

Warum ist dies strategisch interessant?

Der Markt für die Inferenz offener Modelle wird zunehmend zur Commodity, da jeder dieselben Gewichte herunterladen und denselben Dienst betreiben kann. Das erschwert hohe Margen, es sei denn, der Anbieter hat einen klaren Vorteil. Hetzner ist dafür bekannt, Hardware in eigenen Rechenzentren selbst zu kaufen und zu betreiben, mit einer äußerst effizienten Kostenstruktur, was es theoretisch zu einem ernsthaften Kandidaten für den Niedrigpreis-Inferenzmarkt macht. Hinzu kommt das Argument der Kapazitätsauslastung: Während ein gemieteter dedizierter Server einem einzelnen Benutzer unabhängig von der Nutzung gehört, kann eine Inferenz-API die GPU-Kapazität auf mehrere Benutzer verteilen und so die Hardwareauslastung erhöhen.

Eine entscheidende offene Frage, so die Analyse des Autors, der den Dienst getestet hat, ist die Hardware. Das derzeit öffentliche Angebotsverzeichnis von Hetzner für GPU-Server umfasst Workstation-GPUs, die für kleinere und mittlere Modelle geeignet sind, aber nicht für sehr große Modelle, die mehrere High-End-GPUs mit schnellen Verbindungen untereinander erfordern. Der Autor stellt jedoch fest, dass die Hardware hinter der experimentellen API nicht unbedingt identisch mit der im öffentlichen Verzeichnis der dedizierten Server sein muss. Wenn Hetzner plant, das Angebot auf einen größeren Modellkatalog und leistungsstärkere Hardware auszuweiten, könnte der europäische Inferenzmarkt einen neuen ernsthaften Spieler mit dem Ruf aggressiver Preise und zuverlässiger Infrastruktur bekommen.

Häufige Fragen
Kann ich Hetzner Inference jetzt schon für produktive KI-Anwendungen nutzen? +
Nein. Hetzner betont ausdrücklich, dass es sich um ein Experiment ohne Abrechnung, ohne Service-Level-Agreement und ohne Verfügbarkeitsgarantien handelt. Der Dienst ist nicht für Produktionsumgebungen gedacht.
Welches Modell ist bei Hetzner Inference verfügbar? +
Derzeit ist nur das Modell Qwen/Qwen3.6-35B-A3B-FP8 verfügbar, ein Modell mit 35 Milliarden Parametern (3 Milliarden aktiv), das Text und Bilder unterstützt und ein Kontextfenster von 262.000 Token hat.
Warum ist Hetzner als potenzieller KI-Dienstanbieter interessant? +
Hetzner besitzt eigene Rechenzentren und ist bekannt für niedrige Preise und effizientes Wirtschaften, was es zu einem potenziellen Kandidaten für eine günstige europäische Alternative zu amerikanischen Inferenzanbietern macht.
Ist die API mit bestehenden Tools kompatibel, die OpenAI nutzen? +
Ja, Hetzner Inference verwendet ein OpenAI-kompatibles API-Format, das heißt, es kann mit den meisten bestehenden Clients und Tools verwendet werden, die bereits den OpenAI-Standard unterstützen, lediglich URL und API-Schlüssel müssen geändert werden.

Anmelden

Zum Kommentieren müssen Sie sich anmelden oder registrieren.

Kommentare (0)
Noch keine Kommentare. Sei der Erste!
Suchen
Beliebt
✕
Anmelden
Startseite
5MIN.hr als bevorzugte Quelle festlegen
Folge uns in den sozialen Medien
Kategorien