HR EN DE
NEWS SPORT BIZNIS SCENA LIFESTYLE TECH

Hetzner testira vlastiti LLM servis: brz API, ali bez garancija

Europski hosting div pokrenuo eksperimentalni servis za pokretanje jezičnih modela na vlastitoj infrastrukturi. Za sada je dostupan samo jedan model i nema naplate ni jamstava.

Foto: Wikipedia (Qwen)
Ukratko
  • Hetzner je pokrenuo eksperimentalni servis za LLM inferenciju s OpenAI-kompatibilnim API-jem na vlastitoj infrastrukturi.
  • Jedini dostupni model je Qwen/Qwen3.6-35B-A3B-FP8 s 35 milijardi parametara i kontekstnim prozorom od 262 tisuce tokena.
  • Servis je besplatan, ali bez SLA-a, garancija ni podrške za produkcijsku upotrebu.
  • Kljucno pitanje je hoce li Hetzner ulagati u snažniji GPU hardver koji bi mu omogucio širi katalog modela i ozbiljniju tržišnu poziciju.

Hetzner, njemački pružatelj usluga hostinga poznat po agresivnim cijenama i vlastitim podatkovnim centrima, pokrenuo je eksperimentalni servis za LLM (Large Language Model) inferenciju, odnosno pokretanje jezičnih modela putem API-ja. Radi se o ranoj fazi testiranja, a ne o gotovom proizvodu, što tvrtka i sama otvoreno naglašava.

Što je Hetzner Inference i kako funkcionira?

Hetzner Inference je API kompatibilan s OpenAI standardom, što znači da ga razvojni programeri mogu koristiti na isti način kao i druge poznate usluge inferencije, samo s drugačijim URL-om i API ključem. Korisnici kreiraju token u eksperimentalnoj nadzornoj ploči, usmjere OpenAI klijent na Hetznerov poslužitelj i model je spreman za upotrebu. Tvrtka je također objavila kratki vodič za spajanje alata OpenCode na ovaj API, za one koji žele isprobati uslugu bez pisanja koda.

Koji model je dostupan i koje su mu karakteristike?

Jedini trenutno dostupni model je Qwen/Qwen3.6-35B-A3B-FP8, model otvorenih težina kineskog podrijetla. Radi se o Mixture-of-Experts (MoE) arhitekturi s ukupno 35 milijardi parametara, od kojih je u svakom trenutku aktivno samo 3 milijarde, što ga čini efikasnijim za pokretanje. Model prihvaća tekst i slike, ima kontekstni prozor (koliko teksta model 'vidi' odjednom) od 262 tisuće tokena, a težine su mu kvantizirane u FP8 formatu radi smanjenja memorijskog otiska.

Neovisni tester Jonas, koji je API isprobao 23. srpnja 2026., zabilježio je medijalno vrijeme do prvog tokena od 153 milisekunde na već otvorenoj vezi te brzinu od 224 izlazna tokena u sekundi na dužim generacijama. Sam autor napominje da su to rezultati jednog klijenta u jednom trenutku i da ne govore ništa o ponašanju sustava pod opterećenjem većeg broja korisnika.

Ovo je eksperiment, ne proizvod

Hetzner je jasan u pogledu statusa usluge. Prema informacijama dostupnim iz opisa servisa, "this is very much an experiment. There is no billing, no SLA, no production guarantee, and currently only one model". Tvrtka želi saznati postoji li stvarna potražnja za takvom uslugom, kako sustav skalira, koje su funkcionalnosti važne korisnicima i koliko opterećenja može podnijeti. Nema naplate, nema ugovora o razini usluge i nema jamstava dostupnosti.

Zašto je ovo strateški zanimljivo?

Tržište inferencije otvorenih modela postaje sve više robna usluga jer svatko može preuzeti iste težine i pokrenuti identičan servis. To otežava izgradnju visokih marži, osim ako pružatelj nema neku konkretnu prednost. Hetzner je poznat po tome da sam kupuje i operira hardverom u vlastitim podatkovnim centrima s izrazito učinkovitom troškovnom strukturom, što ga u teoriji čini ozbiljnim kandidatom za niskocjenovno tržište inferencije. Uz to, postoji i argument iskorištenosti kapaciteta: dok iznajmljeni namjenski server pripada jednom korisniku bez obzira koristi li ga ili ne, API za inferenciju može dijeliti GPU kapacitet među više korisnika i tako povećati iskorištenost hardvera.

Ključno otvoreno pitanje, prema analizi autora koji je testirao servis, jest hardver. Trenutni javni Hetznerov ponudbeni katalog za GPU servere uključuje radne stanice GPU kartice, koje su prikladne za manje i srednje modele, ali ne i za pokretanje vrlo velikih modela koji zahtijevaju višestruke GPU-ove visoke klase s brzim međusobnim vezama. No, autor napominje da hardver koji stoji iza eksperimentalnog API-ja ne mora biti identično onome što je dostupno u javnom katalogu namjenskih servera. Ako Hetzner planira proširiti ponudu na veći katalog modela i snažniji hardver, europsko tržište inferencije moglo bi dobiti novog ozbiljnog igrača s reputacijom agresivnih cijena i pouzdane infrastrukture.

Česta pitanja
Mogu li vec sada koristiti Hetzner Inference za produkcijske AI aplikacije? +
Ne. Hetzner jasno naglašava da se radi o eksperimentu bez naplate, bez ugovora o razini usluge i bez garancija dostupnosti. Servis nije namijenjen produkcijskim okruženjima.
Koji model je dostupan na Hetzner Inference? +
Trenutno je dostupan samo model Qwen/Qwen3.6-35B-A3B-FP8, model s 35 milijardi parametara (3 milijarde aktivnih) koji podržava tekst i slike te ima kontekstni prozor od 262 tisuce tokena.
Zašto je Hetzner zanimljiv kao potencijalni pružatelj AI usluga? +
Hetzner posjeduje vlastite podatkovne centre i poznata je po niskim cijenama i ucinkovitom poslovanju, što ga cini potencijalnim kandidatom za jeftinu europsku alternativu americkim pružateljima inferencije.
Je li API kompatibilan s postojecim alatima koji koriste OpenAI? +
Da, Hetzner Inference koristi OpenAI-kompatibilan API format, što znaci da se može koristiti s vecinom postojecih klijenata i alata koji vec podržavaju OpenAI standard, uz promjenu URL-a i API kljuca.

Prijavi se

Za komentiranje je potrebna prijava ili registracija.

Komentari (0)
Nema komentara. Budi prvi!
Traži
Popularno
Prijava
Pocetna
Označi 5MIN.hr kao omiljeni izvor
Zaprati nas na društvenim mrežama
Kategorije