Helyi AI
Llama
A Llama a Meta nagy nyelvi modellcsaládja, amelynek súlyai letölthetők és helyben futtathatók. A licenc azonban saját feltételekkel jár.
A Llama a Meta nagy nyelvi modellcsaládja. A Meta nem csak hosztolt API-t ad hozzá: a súlyok letölthetők, és a saját hardveren futtathatók. Ez a lényeg számunkra, mert a bemenetek és a kimenetek nem hagyják el a gépet, és a futtatáshoz nem kell külső szolgáltatás.
A család több méretben él, az edge eszközökre szánt kis változatoktól a szerveren futó modellekig. A kiadás a Meta saját licence alatt történik, ezért a terjesztés és a kereskedelmi felhasználás feltételekhez kötött. A feltételeket a szerződés szövege mondja meg, nem a marketingszöveg.
Mi tartozik a családba?
A legutóbbi generáció a Llama 4, amely két modellből áll, és a model card szerint natívan multimodális, korai fúzióval. Mindkettő mixture-of-experts architektúrát használ:
- Llama 4 Scout: 17 milliárd aktív paraméter 16 szakértővel, összesen 109 milliárd paraméter, 10 millió tokenes kontextusablak.
- Llama 4 Maverick: 17 milliárd aktív paraméter 128 szakértővel, összesen 400 milliárd paraméter, 1 millió tokenes kontextusablak.
A model card 12 támogatott nyelvet sorol fel, a magyar nincs köztük. Az előtanítás ennél szélesebb nyelvkészletet fedett, és a Meta engedi a finomhangolást további nyelvekre, a licenc és a használati szabályzat betartásával.
A korábbi generációk is elérhetők: a Llama 3.2 1B és 3B változatát a Meta eszközön futó és edge célra optimalizálta, a Llama 3.1 pedig 8B, 70B és 405B méretben érhető el. A gyakorlatban a kis modellek férnek el egyetlen gépen.
Hogyan lehet hozzájutni a súlyokhoz?
A letöltés nem névtelen. A llama.com letöltési oldalán kérni kell a hozzáférést, valódi névvel, születési dátummal és a szervezet adataival, majd el kell fogadni a licencet. A modellek a Meta partnereinél is elérhetők, és a Hugging Face-en is vannak hivatalos repók, szintén licencelfogadás után. A hosztoló szolgáltatásoknak saját feltételeik lehetnek.
Hardver és kvantálás
A Meta gyakori kérdések oldala szerint a hardverigény modellfüggő, és a késleltetés, az átbocsátóképesség meg a költség dönti el, mi kell hozzá. A nagyobb modelleket több inferenciachipre osztva, tenzorpárhuzamosítással szokás futtatni. A modellek futnak GPU-n, x86 és ARM processzoron, TPU-n, NPU-n és egyéb gyorsítón, a kisebbek pedig rendszerchippen is.
A Llama 4 model card konkrétumokat is ad:
- A Scout BF16 súlyokkal jelenik meg, és a Meta szerint menet közbeni int4 kvantálással elfér egyetlen H100 GPU-n.
- A Maverick BF16 és FP8 kvantált súlyokkal is megjelenik, az FP8 változat egy H100 DGX hoszton elfér.
A kvantálás ára dokumentált: a Meta kvantált checkpointokat ad a telepítési rugalmasság érdekében, de a kiértékeléseket BF16 modelleken futtatta. A méret és a minőség közötti döntést tehát nem lehet ingyen meghozni, érdemes a saját feladaton mérni.
Mit mond a licenc?
A Llama 4 a Llama 4 Community License Agreement alatt jelenik meg, amelynek hatályba lépése 2025. április 5. A model card maga saját kereskedelmi licencnek (custom commercial license) nevezi, tehát ez nem szabványos nyílt forráskódú licenc. A szerződés szerint a jogosultság nem kizárólagos, világméretű, nem átruházható és jogdíjmentes: a súlyokat használni, másolni, terjeszteni, módosítani és származtatott mű készítéséhez felhasználni lehet.
A feltételek röviden:
- Terjesztéskor a licenc egy példányát mellékelni kell, és jól láthatóan fel kell tüntetni a “Built with Llama” feliratot a kapcsolódó weboldalon, felületen vagy dokumentációban.
- Származtatott modellnél, ha a kimeneteket más modell tanítására használjuk, a modell nevének az elején szerepelnie kell a Llama szónak.
- Névfeltüntetés: a terjesztett példányoknál meg kell tartani a Notice szövegfájlt a szerzői jogi mondattal.
- 700 millió havi aktív felhasználó felett a licenc nem elég, külön jogosultságot kell kérni a Metától, és addig a jogok nem gyakorolhatók.
- Használati szabályzat: az acceptable use policy a szerződés részévé válik, és tiltott felhasználásokat sorol fel, például a kritikus infrastruktúra üzemeltetését.
- EU-s korlátozás: a Llama 3.2, 3.3 és 4 használati szabályzata az EU-ban bejegyzett cégekre és az EU-ban lakó magánszemélyekre külön korlátozást tartalmaz a multimodális modelleknél. Minket, magyar céget ez közvetlenül érint, ezért ezt a pontot minden projektnél átnézzük.
A licenc emellett kizárja a garanciát, és a Metával szembeni perindítás esetén a jogosultság megszűnik.
Hol használjuk nálunk?
A helyi modelleket LM Studio segítségével futtatjuk, és OpenAI-kompatibilis végponton keresztül érhetők el a saját gépeinken. Így az adat nem hagyja el a hosztot, a Hermes Agent pedig ugyanúgy tudja hívni, mint egy távoli szolgáltatást. Ahol több folyamatot kell összekötni, ott Docker adja a keretet. A magyar nyelvű fordítói feladatainkhoz is helyi modellt használunk.
Tovább olvasás
- Llama 4 Community License Agreement - a licenc teljes szövege, ezt kell elfogadni a súlyok használatához.
- Llama 4 model card - architektúra, kontextushossz, kvantálás és a támogatott nyelvek listája.
- Llama FAQ - a Meta válaszai a hardverre, a licencre és az EU-s korlátozásra.