Čo je private inference a kedy ho firma potrebuje?
Private inference je prevádzkovanie jazykových modelov na infraštruktúre, ktorú kontroluje zákazník, takže prompty, vyhľadané dokumenty ani generovaný výstup neopustia jeho bezpečnostný perimeter. Používa sa vtedy, keď regulácia, pravidlá o mieste uloženia dát alebo interná politika bránia organizácii posielať prevádzkové dáta do komerčného modelového API. V praxi to znamená open-weight modely na vlastných GPU zákazníka, pričom aplikačná, governance a auditná vrstva nad nimi zostáva nezmenená.
Kedy to firma naozaj potrebuje
Väčšina AI workloadov private inference nepotrebuje. Komerčné modelové API sú lacnejšie na token, vo väčšine úloh silnejšie a nevyžadujú prácu s infraštruktúrou. Private inference sa oplatí v úzkom okruhu prípadov.
Prvým je právna alebo zmluvná prekážka. Niektoré regulované inštitúcie nesmú prenášať prevádzkové dáta mimo vymedzenej jurisdikcie alebo mimo vlastnej tenancy, bez ohľadu na certifikácie poskytovateľa.
Druhým je klasifikácia dát. Organizácia môže bežne používať komerčné API, no jedna konkrétna trieda dát, napríklad klientske záznamy alebo interné rizikové materiály, nesmie byť súčasťou žiadneho externého volania.
Tretím je koncentrácia dodávateľa. Niektoré inštitúcie vyžadujú preukázateľnú náhradu pre kritické procesy, aby výpadok alebo zmena podmienok jedného dodávateľa nezastavila prevádzkový workflow.
Ak neplatí ani jedno z toho, private inference pridáva náklad a prevádzkovú záťaž bez pridanej hodnoty.
Dimenzovanie vychádza zo súbežnosti, nie z počtu používateľov
Najčastejšou chybou pri dimenzovaní je odhadovať potrebu GPU z počtu ľudí, ktorí budú systém používať. To číslo o záťaži nehovorí takmer nič.
Kapacitu určuje, koľko požiadaviek sa obsluhuje súčasne a aký dlhý kontext má každá z nich. Workload postavený na vyhľadávaní s dlhým kontextom sa správa úplne inak než krátke konverzačné výmeny, aj pri rovnakom počte používateľov.
Vo feasibility štúdii pre slovenského telekomunikačného operátora dosiahol vyhľadávací workload pri 32K kontexte približne 33 sekúnd do prvého tokenu pri jednom používateľovi. Pri piatich súbežných používateľoch sa ten istý workload pohyboval zhruba od 101 do 169 sekúnd. Zvýšenie kontextu na 100K znížilo efektívnu súbežnosť vLLM na približne 1,64.
Tie čísla platia pre konkrétny model, konkrétny hardvér a konkrétny workload. Prenositeľná je metóda: dimenzovať z nameranej špičkovej súbežnosti a zo skutočného rozloženia dĺžok kontextu, na vlastných dokumentoch organizácie.
Chyby v konfigurácii vyzerajú presne ako zlyhanie modelu
Tá istá štúdia priniesla zistenie, ktoré stojí za zopakovanie, pretože sa naň dá naletieť spôsobom, ktorý stojí reálne peniaze.
Prvé kolo testov uzavrelo, že modely veľkosti 7B a 8B nedokážu produkovať prijateľnú slovenčinu a že praktickým minimom pre jazyk je 70B. Ten záver bol nesprávny.
Pri opakovanom teste s deterministickým nastavením, minimálne tromi behmi na prípad, overenými chat template a objektívnou detekciou cudzích písiem sa ukázalo, že degradovaný výstup bol artefakt konfigurácie. Chat template vo vLLM bol nesprávny alebo chýbal. So správnym template ten istý 8B model neprodukoval cudzie písmo vôbec a stal sa použiteľným, s výhradami.
Dôsledok je finančný. Nesprávny záver na tomto mieste posúva požiadavku z 24GB karty na 80GB, čo je zhruba päťnásobný rozdiel v mesačnom náklade. Disciplína v meraní rozhoduje viac než počet parametrov.
Správanie modelu je navyše špecifické pre úlohu a jazyk spôsobom, ktorý publikované benchmarky neukazujú. V tých istých testoch jeden 72B model produkoval v slovenskom výstupe čínske znaky a jeden reasoning model vložil do odpovede vlastnú úvahu v angličtine.
Ako vyzerali namerané tiery
Z testovania vyšli tri tiery. Primárny slovenský tier s EuroLLM-22B v BF16 na A100 80GB. Rozpočtový tier s Llama 3.1 8B v BF16 na 24GB kartách ako L4, A10G alebo RTX 4090. Tier pre dlhý kontext s Llama 3.3 70B AWQ na H100 NVL.
Každý tier bol viazaný na konkrétne verzie vLLM a ovládačov. Aktualizácia ovládača alebo runtime dokáže zmeniť výstup aj latenciu, takže fixovanie verzií patrí do zmluvy o nasadení, nie do prevádzkovej príručky.
Čo sa nemení, keď sa model presunie
Model je jednou zložkou podnikového AI nasadenia a zvyčajne nie tou, ktorá nesie governance záťaž.
Routing rozhoduje, ktorý model a ktorá infraštruktúra spracuje danú úlohu. Oprávnenia určujú, čo agent smie robiť a ktoré dáta smie čítať. Verifikácia kontroluje výstup voči kvalitatívnej latke skôr, než sa použije. Audit trail zaznamenáva, čo sa stalo a na akom základe.
V týchto štyroch funkciách sídli auditovateľnosť a kontrola. Keď sú v platformovej vrstve a nie vnútri integrácie modelu, presun workloadu z komerčného API na self-hosted model je konfiguračná zmena, nie prestavba. Práve táto prenositeľnosť robí sovereign variant ekonomicky vôbec zmysluplným.
Hranice toho, čo sme namerali
Uviesť hranice je súčasť metódy, takže tu sú naše.
Išlo o posúdenie realizovateľnosti, nie o produkčné nasadenie, a používali sa syntetické prompty, nie reálna produkčná prevádzka klienta.
Testované modely boli generácie 2025. Je to hĺbkový pohľad na slovenčinu, nie výpoveď o aktuálnom stave open-weight modelov.
Kvantizovaný EuroLLM na 24GB kartách overený nebol, pretože jeden kvantizačný test zlyhal a nebol zopakovaný. Čistý údaj o latencii pri 100K kontexte bol extrapolovaný, nie nameraný.
Kto dimenzuje nasadenie z publikovaných čísel, vrátane našich, mal by ich brať ako vstupnú hypotézu a pred záväzkom k hardvéru spraviť krátky platený pilot na vlastných promptoch a vlastných dokumentoch.
Ako spolupracujeme s NVIDIA
Elevon.io je členom programu NVIDIA Inception. Pre túto časť našej práce sú relevantné vývojárske nástroje, technické zdroje, zvýhodnené ceny hardvéru a kredity na GPU cloud, ktoré znižujú náklad na otestovanie konfigurácie skôr, než zákazník viaže kapitálové výdavky.
Je to podstatné preto, lebo poctivý postup pri private inference je najprv preukázať potrebu na prenajatých GPU a hardvér kúpiť až naposledy. Prístup do programu zlacňuje krok preukazovania, čím rastie pravdepodobnosť, že sa naozaj spraví.
Kde začať
Ak vám niekto povedal, že konkrétny AI use case je nemožný, pretože dáta nesmú opustiť vaše prostredie, je to obmedzenie toho, kde beží inferencia. Nie je to obmedzenie toho, či je use case realizovateľný.
Prvým krokom nie je obstarávanie. Je ním krátke meranie na vašich dátach, pri vašich dĺžkach kontextu a pri očakávanej súbežnosti, ktoré povie, koľko by nasadenie reálne stálo.
