Vissza az eszközökhöz

Helyi AI

Llama

A Llama a Meta nagy nyelvi modellcsaládja, amelynek súlyai letölthetők és helyben futtathatók. A licenc azonban saját feltételekkel jár.

4 perc olvasás

A Llama a Meta nagy nyelvi modellcsaládja. A Meta nem csak hosztolt API-t ad hozzá: a súlyok letölthetők, és a saját hardveren futtathatók. Ez a lényeg számunkra, mert a bemenetek és a kimenetek nem hagyják el a gépet, és a futtatáshoz nem kell külső szolgáltatás.

A család több méretben él, az edge eszközökre szánt kis változatoktól a szerveren futó modellekig. A kiadás a Meta saját licence alatt történik, ezért a terjesztés és a kereskedelmi felhasználás feltételekhez kötött. A feltételeket a szerződés szövege mondja meg, nem a marketingszöveg.

Mi tartozik a családba?

A legutóbbi generáció a Llama 4, amely két modellből áll, és a model card szerint natívan multimodális, korai fúzióval. Mindkettő mixture-of-experts architektúrát használ:

  • Llama 4 Scout: 17 milliárd aktív paraméter 16 szakértővel, összesen 109 milliárd paraméter, 10 millió tokenes kontextusablak.
  • Llama 4 Maverick: 17 milliárd aktív paraméter 128 szakértővel, összesen 400 milliárd paraméter, 1 millió tokenes kontextusablak.

A model card 12 támogatott nyelvet sorol fel, a magyar nincs köztük. Az előtanítás ennél szélesebb nyelvkészletet fedett, és a Meta engedi a finomhangolást további nyelvekre, a licenc és a használati szabályzat betartásával.

A korábbi generációk is elérhetők: a Llama 3.2 1B és 3B változatát a Meta eszközön futó és edge célra optimalizálta, a Llama 3.1 pedig 8B, 70B és 405B méretben érhető el. A gyakorlatban a kis modellek férnek el egyetlen gépen.

Hogyan lehet hozzájutni a súlyokhoz?

A letöltés nem névtelen. A llama.com letöltési oldalán kérni kell a hozzáférést, valódi névvel, születési dátummal és a szervezet adataival, majd el kell fogadni a licencet. A modellek a Meta partnereinél is elérhetők, és a Hugging Face-en is vannak hivatalos repók, szintén licencelfogadás után. A hosztoló szolgáltatásoknak saját feltételeik lehetnek.

Hardver és kvantálás

A Meta gyakori kérdések oldala szerint a hardverigény modellfüggő, és a késleltetés, az átbocsátóképesség meg a költség dönti el, mi kell hozzá. A nagyobb modelleket több inferenciachipre osztva, tenzorpárhuzamosítással szokás futtatni. A modellek futnak GPU-n, x86 és ARM processzoron, TPU-n, NPU-n és egyéb gyorsítón, a kisebbek pedig rendszerchippen is.

A Llama 4 model card konkrétumokat is ad:

  • A Scout BF16 súlyokkal jelenik meg, és a Meta szerint menet közbeni int4 kvantálással elfér egyetlen H100 GPU-n.
  • A Maverick BF16 és FP8 kvantált súlyokkal is megjelenik, az FP8 változat egy H100 DGX hoszton elfér.

A kvantálás ára dokumentált: a Meta kvantált checkpointokat ad a telepítési rugalmasság érdekében, de a kiértékeléseket BF16 modelleken futtatta. A méret és a minőség közötti döntést tehát nem lehet ingyen meghozni, érdemes a saját feladaton mérni.

Mit mond a licenc?

A Llama 4 a Llama 4 Community License Agreement alatt jelenik meg, amelynek hatályba lépése 2025. április 5. A model card maga saját kereskedelmi licencnek (custom commercial license) nevezi, tehát ez nem szabványos nyílt forráskódú licenc. A szerződés szerint a jogosultság nem kizárólagos, világméretű, nem átruházható és jogdíjmentes: a súlyokat használni, másolni, terjeszteni, módosítani és származtatott mű készítéséhez felhasználni lehet.

A feltételek röviden:

  • Terjesztéskor a licenc egy példányát mellékelni kell, és jól láthatóan fel kell tüntetni a “Built with Llama” feliratot a kapcsolódó weboldalon, felületen vagy dokumentációban.
  • Származtatott modellnél, ha a kimeneteket más modell tanítására használjuk, a modell nevének az elején szerepelnie kell a Llama szónak.
  • Névfeltüntetés: a terjesztett példányoknál meg kell tartani a Notice szövegfájlt a szerzői jogi mondattal.
  • 700 millió havi aktív felhasználó felett a licenc nem elég, külön jogosultságot kell kérni a Metától, és addig a jogok nem gyakorolhatók.
  • Használati szabályzat: az acceptable use policy a szerződés részévé válik, és tiltott felhasználásokat sorol fel, például a kritikus infrastruktúra üzemeltetését.
  • EU-s korlátozás: a Llama 3.2, 3.3 és 4 használati szabályzata az EU-ban bejegyzett cégekre és az EU-ban lakó magánszemélyekre külön korlátozást tartalmaz a multimodális modelleknél. Minket, magyar céget ez közvetlenül érint, ezért ezt a pontot minden projektnél átnézzük.

A licenc emellett kizárja a garanciát, és a Metával szembeni perindítás esetén a jogosultság megszűnik.

Hol használjuk nálunk?

A helyi modelleket LM Studio segítségével futtatjuk, és OpenAI-kompatibilis végponton keresztül érhetők el a saját gépeinken. Így az adat nem hagyja el a hosztot, a Hermes Agent pedig ugyanúgy tudja hívni, mint egy távoli szolgáltatást. Ahol több folyamatot kell összekötni, ott Docker adja a keretet. A magyar nyelvű fordítói feladatainkhoz is helyi modellt használunk.

Tovább olvasás

Címkék
  • nyílt súlyú
  • helyi futtatás
  • LLM
  • kvantálás
  • licenc