Helyi AI
gpt-oss
A gpt-oss az OpenAI nyílt súlyú modellcsaládja: két méret, Apache 2.0 licenc. Nálunk egyetlen munkaállomáson fut, fordítási és kötegelt feladatokra.
A gpt-oss az OpenAI nyílt súlyú modellcsaládja, amely 2025. augusztus 5-én jelent meg, és a GPT-2 óta az első ilyen kiadásuk. Két változat van belőle: a gpt-oss-120b (117 milliárd paraméter, ebből 5,1 milliárd aktív) és a gpt-oss-20b (21 milliárd paraméter, 3,6 milliárd aktív). Mindkettő szöveges, reasoning jellegű MoE-modell: a teljes paraméterszám nagy, de tokenenként csak a hálózat egy kis része dolgozik, ezért a futási költség egy jóval kisebb sűrű modellhez hasonlít.
A súlyok Apache 2.0 licenc alatt érhetők el, egy rövid kiegészítő használati irányelvvel. A modellkártya szerint a nagyobbik változat egyetlen 80 GB-os GPU-n (NVIDIA H100 vagy AMD MI300X) elfér, a kisebbik pedig 16 GB memórián belül fut. Ez a család lényege: nem klasztert igényel, hanem egy munkaállomást.
Méretek és memóriaigény
- gpt-oss-20b: 21 milliárd paraméter, 3,6 milliárd aktív. A modellkártya szerint 16 GB memórián belül elfut, az LM Studio hivatalos útmutatója legalább 16 GB VRAM-ot ír elő hozzá.
- gpt-oss-120b: 117 milliárd paraméter, 5,1 milliárd aktív. A modellkártya egy 80 GB-os GPU-t nevez meg, az LM Studio útmutatója legalább 60 GB VRAM-ot javasol, több GPU-val vagy nagyobb munkaállomáson.
- Mindkét modell 128k tokenes kontextusablakkal dolgozik, a MoE súlyok pedig MXFP4 kvantálással készültek. Minden nyilvános kiértékelés ezzel a kvantálással történt, tehát ez a kiadott modell része, nem utólagos karcsúsítás.
Az architektúra is dokumentált: a figyelem rétegek váltakozva teljes kontextust és 128 tokenes csúszóablakot használnak, és minden fejhez tanult attention sink tartozik.
Milyen formátumot vár?
A gpt-oss-t a harmony nevű üzenetformátumra tanították, és a dokumentáció szerint kizárólag ezzel szabad használni, különben nem működik helyesen. A formátum öt szerepet különböztet meg (system, developer, user, assistant, tool), az assistant válaszait pedig csatornákra bontja: a final a felhasználónak szánt szöveg, az analysis a gondolatmenet, a commentary az eszközhívások helye.
A gondolatmenethez teljes hozzáférés van, ami megkönnyíti a hibakeresést, de a dokumentáció figyelmeztet: az analysis csatorna tartalma nem esik ugyanazon biztonsági mérce alá, mint a végleges válasz, és nem a végfelhasználónak szól.
A reasoning szint a system üzenetben állítható (low, medium, high). A low gyors válaszokat ad párbeszédhez, a high mélyebb elemzést. Ez a gyakorlatban azt jelenti, hogy ugyanaz a súlykészlet kiszolgálja a gyors kéréseket és a nehezebb feladatokat is.
Hogyan szolgáljuk ki?
A család szinte minden elterjedt futtatóval megy: Transformers, vLLM, llama.cpp, Ollama és LM Studio. Utóbbi az lms get paranccsal tölti le a modellt, a bemenetet pedig a harmony könyvtárral építi fel. Az LM Studio helyi /v1/chat/completions végpontot nyit API-kulcs nélkül, így a meglévő OpenAI SDK-s kód gyakorlatilag változatlan marad, csak a base URL-t kell átírni. A vLLM és a Transformers szintén OpenAI-kompatibilis szervert indít, a modellkártya pedig a Responses API-t nevezi meg ajánlott interfészként. Az ajánlott mintavétel: temperature 1.0 és top_p 1.0.
Az eszközhasználat séma szerinti függvényhívást, beépített böngésző és Python eszközt, valamint strukturált kimenetet jelent. A repository referenciaként tartalmazza a böngésző és a Python eszköz implementációját, egy terminálos chat klienssel együtt.
Amire figyelni kell
- A formátum nem választás kérdése. Harmony nélkül a kimenet hibás lesz, nem csak gyengébb.
- A gondolatmenet nem felhasználói tartalom. Az analysis csatornát a dokumentáció kifejezetten nem szánja a végfelhasználónak.
- A referenciakód nem éles kód. A repository PyTorch implementációja oktatási célú, és a saját leírása szerint legalább 4 H100 kártyát igényel; a referencia implementációk Windows alatt nem teszteltek.
- Kvantálás. A mérések a kiadott MXFP4-es súlyokra vonatkoznak; egy másik kvantálás már más modell.
- A nyílt súly nem visszavonható. A modellkártya kimondja, hogy a súlyok kiadása után a biztonsági elutasítások finomhangolással megkerülhetők, utólagos védelemre vagy a hozzáférés visszavonására nincs mód, ezért a rendszerszintű védelmet a telepítőnek kell megépítenie.
Nálunk a döntés egyszerű volt: a gpt-oss-20b pontosan akkora, hogy egyetlen munkaállomáson elférjen, ezért a CyberElectro a helyi fordítási és egyéb kötegelt feladatait ezzel a modellel futtatja. Az LM Studio adja az OpenAI-kompatibilis végpontot, a futás Docker alatt marad, így a Hermes Agent ugyanúgy hívhatja, mint egy távoli szolgáltatást.
Tovább olvasás
- openai/gpt-oss - a modellek, a referencia implementációk és az eszközök forrása.
- gpt-oss-120b & gpt-oss-20b Model Card - a méretek, a licenc és a biztonsági értékelés hivatalos leírása.
- OpenAI harmony response format - a beszélgetésformátum, a csatornák és a reasoning szint dokumentációja.