Hetzner testira vlastiti LLM servis: brz API, ali bez garancija
Europski hosting div pokrenuo eksperimentalni servis za pokretanje jezičnih modela na vlastitoj infrastrukturi. Za sada je dostupan samo jedan model i nema naplate ni jamstava.
Europski hosting div pokrenuo eksperimentalni servis za pokretanje jezičnih modela na vlastitoj infrastrukturi. Za sada je dostupan samo jedan model i nema naplate ni jamstava.
Hetzner, njemački pružatelj usluga hostinga poznat po agresivnim cijenama i vlastitim podatkovnim centrima, pokrenuo je eksperimentalni servis za LLM (Large Language Model) inferenciju, odnosno pokretanje jezičnih modela putem API-ja. Radi se o ranoj fazi testiranja, a ne o gotovom proizvodu, što tvrtka i sama otvoreno naglašava.
Hetzner Inference je API kompatibilan s OpenAI standardom, što znači da ga razvojni programeri mogu koristiti na isti način kao i druge poznate usluge inferencije, samo s drugačijim URL-om i API ključem. Korisnici kreiraju token u eksperimentalnoj nadzornoj ploči, usmjere OpenAI klijent na Hetznerov poslužitelj i model je spreman za upotrebu. Tvrtka je također objavila kratki vodič za spajanje alata OpenCode na ovaj API, za one koji žele isprobati uslugu bez pisanja koda.
Jedini trenutno dostupni model je Qwen/Qwen3.6-35B-A3B-FP8, model otvorenih težina kineskog podrijetla. Radi se o Mixture-of-Experts (MoE) arhitekturi s ukupno 35 milijardi parametara, od kojih je u svakom trenutku aktivno samo 3 milijarde, što ga čini efikasnijim za pokretanje. Model prihvaća tekst i slike, ima kontekstni prozor (koliko teksta model 'vidi' odjednom) od 262 tisuće tokena, a težine su mu kvantizirane u FP8 formatu radi smanjenja memorijskog otiska.
Neovisni tester Jonas, koji je API isprobao 23. srpnja 2026., zabilježio je medijalno vrijeme do prvog tokena od 153 milisekunde na već otvorenoj vezi te brzinu od 224 izlazna tokena u sekundi na dužim generacijama. Sam autor napominje da su to rezultati jednog klijenta u jednom trenutku i da ne govore ništa o ponašanju sustava pod opterećenjem većeg broja korisnika.
Hetzner je jasan u pogledu statusa usluge. Prema informacijama dostupnim iz opisa servisa, "this is very much an experiment. There is no billing, no SLA, no production guarantee, and currently only one model". Tvrtka želi saznati postoji li stvarna potražnja za takvom uslugom, kako sustav skalira, koje su funkcionalnosti važne korisnicima i koliko opterećenja može podnijeti. Nema naplate, nema ugovora o razini usluge i nema jamstava dostupnosti.
Tržište inferencije otvorenih modela postaje sve više robna usluga jer svatko može preuzeti iste težine i pokrenuti identičan servis. To otežava izgradnju visokih marži, osim ako pružatelj nema neku konkretnu prednost. Hetzner je poznat po tome da sam kupuje i operira hardverom u vlastitim podatkovnim centrima s izrazito učinkovitom troškovnom strukturom, što ga u teoriji čini ozbiljnim kandidatom za niskocjenovno tržište inferencije. Uz to, postoji i argument iskorištenosti kapaciteta: dok iznajmljeni namjenski server pripada jednom korisniku bez obzira koristi li ga ili ne, API za inferenciju može dijeliti GPU kapacitet među više korisnika i tako povećati iskorištenost hardvera.
Ključno otvoreno pitanje, prema analizi autora koji je testirao servis, jest hardver. Trenutni javni Hetznerov ponudbeni katalog za GPU servere uključuje radne stanice GPU kartice, koje su prikladne za manje i srednje modele, ali ne i za pokretanje vrlo velikih modela koji zahtijevaju višestruke GPU-ove visoke klase s brzim međusobnim vezama. No, autor napominje da hardver koji stoji iza eksperimentalnog API-ja ne mora biti identično onome što je dostupno u javnom katalogu namjenskih servera. Ako Hetzner planira proširiti ponudu na veći katalog modela i snažniji hardver, europsko tržište inferencije moglo bi dobiti novog ozbiljnog igrača s reputacijom agresivnih cijena i pouzdane infrastrukture.