Miről szól ez a lecke: a legfontosabb pontok
- Egy LLM következő-token-prediktor. A bemenet után minden lehetséges tokenre valószínűséget számol, és választ. Aztán ismétli. A teljes válasz így épül föl.
- Két fázis, élesen szétválasztva. A tanítás egyszer történik, milliárd dolláros művelet. A használat azóta megy, de nem épít új tudást. A beszélgetésed nem marad benne a modellben.
- A sokdimenziós tér adja a gazdagságot. A tokenek vektorként élnek, és a közeli vektorok jelentésben is közel állnak. Innen jön, hogy nem szótár-szinten válaszol.
- Az érték a kontextusban van. Általános kérdésre jól tud válaszolni a saját tudásából. Cégspecifikusra csak akkor, ha be tudod tenni az adatot, a dokumentumot, vagy a connector-on át az élő rendszert.
Tegyük be egy modellbe, hogy „Magyarország fővárosa…", és állítsuk meg a szóköznél. Mi történik a következő ezredmásodpercben? A modell gondolkodik végigfut a saját paraméterein, és kiszámolja, hogy a vokabulárium minden tokenjének mekkora a valószínűsége arra, hogy az kerüljön ide. Hogy pontosan hogyan épül fel ebből egy teljes válasz, azt a §3-ban bontjuk ki.
Egyetlen mondatot vigyél magaddal az egész leckéből: az LLM egy következő-token-prediktor, ami sokdimenziós térben dolgozik egy befagyott adathalmazon. Ebből vezethető le, miért hibázik, miért segít, miért kell neki kontextus, és miért nem ugyanazt válaszolja kétszer. Négy fogalmon keresztül járjuk körbe: token, predikció, tanítás, használat.
Egy token nem szó. Néha kevesebb, néha több.
A modell nem szavakkal számol. Tokenekkel. Egy token nagyjából 3–4 karakter, vagy egy gyakori szó. A „Hello" egy token. Az „Apple" is egy. Az „Apples" már kettő (a többes-szám-jelet külön darabolja). A magyarban a ragozás miatt általában több token jut egy szóra, mint az angolban.
Miért fontos ez vezetőként, és nem fejlesztőként? Három okból. Egy: a modell áraz token alapján, az API-fizetésed innen jön. Kettő: a kontextus-ablak, vagyis amennyit a modell egyszerre lát, tokenben van mérve. Egy 200 ezer tokenes ablak nagyjából egy regény. A nagyobb Claude-modellek 1 millió tokenes ablaka két regény, plusz. Három: ha tudod, hogy egy 50 oldalas üzleti dokumentum nagyjából 35 ezer token, érzéked van, mi fér be egyszerre, és mi nem.
Két fázis: tanítás egyszer, használat sokszor
A modell életében két élesen különálló fázis van, és a kettő összemosása a leggyakoribb félreértés. A tanítás egyszer fut le, milliárd dolláros művelet, a végén a modell tudása rögzül. A használat azóta megy, milliárdszor naponta, fillérekért per kérdés. Ami a tanításba nem került bele, az a modell számára nem létezik. Amit most beszélünk vele, nem épül be holnapra. A chat-élmény folytonosnak tűnik, mégis minden válasz egy befagyott állapotú modellből jön.
A modell olvas 10-15 ezermilliárd (angolul: trillió) tokent, lényegében az internet jelentős részét és könyvtárakat. Minden példánál ugyanaz a feladat: mi a következő token, ha eddig ezt látom?
- hetekig, hónapokig fut
- milliárd dollár nagyságrendű capex egy frontier modellnél
- tízezres GPU-cluster kell hozzá
- eredmény: 1-3 ezermilliárd tanult paraméter
- modellverziónként egyszer történik meg
Te kérdezel, a modell a tanult paraméterei alapján válaszol, tokenről tokenre. A tudása nem nő közben.
- másodperces nagyságrend, ezred-dollár per kérdés
- évente már több compute, mint a tanítás
- a beszélgetésedből nem épít új tudást
- knowledge-cutoff után semmit nem tud a világról
- ez az, amit a 3-4. modulban tanulsz kezelni
Ha ezt a két fázist érted, akkor érted azt is, miért nincs értelme a modellt „megtanítani" arra, hogy „a mi cégünk így működik". Nem így megy. A modell felé minden cégspecifikus tudást a kontextusban kell odacsempészned, mert a tanításában nem volt benne, és a beszélgetésből nem marad meg.
A predikció: minden válasz egy token-lánc
A modell egyetlen dolgot csinál. A bemenet után kiszámolja, hogy a vokabulárium minden lehetséges tokenjének mekkora a valószínűsége arra, hogy következő legyen, és választ közülük egyet. Az új tokent hozzáragasztja a bemenethez, és ugyanezt megcsinálja megint, akár ezerszer is. A teljes válasz, akármilyen okosnak tűnik, így épül föl.
Példa. A bemenet: „Magyarország fővárosa". A modell a saját paramétereiből kihúzza, hogy a következő token valószínűségi eloszlása nagyjából így néz ki:
Itt a Budapest 81%-on van, vagyis tízből nyolc-kilenc esetben ezt fogja választani. A Pest 9%, a Buda 4%, a többi szétoszlik. Egy modell nem mindig ugyanazt mondja, mert a választást nem mindig a legmagasabb valószínűségen szögezi le. A „hőmérséklet" (temperature) paraméter szabályozza, mennyit mer eltérni: 0-án mindig a legvalószínűbbet veszi, 0.7 körül egy kicsit mer, 1.0 fölött szabad asszociáció jön.
Mindez egy sokdimenziós térben zajlik. A modell nem szavakat lát, hanem vektorokat: minden token egy pötty egy több ezer dimenziós térben. Mi két dimenziót látunk egy papíron, a modell több ezret a fejében. Ebben a térben a jelentés a távolságból olvasható ki. Hogy ezt egyszerűbben lássuk, egy 2D-vetítés segít. A valóságban a tengelyek nem így néznek ki, de a klaszteresedés érzete pont ezt mutatja.
A „király" és a „királynő" közel állnak egymáshoz. A „Párizs" közel a „Franciaország"-hoz. A „bank" pénzügyi értelmében a „kölcsön" mellett ül, folyópart-értelmében a „víz" mellett. Ugyanaz a szó, két különböző hely a térben, attól függően, milyen szövegkörnyezetben került elő. Ezeket a kapcsolatokat a tanítás során alakította ki a modell, és innen jön az a tapasztalat, hogy nem szótár-keresgélést érzünk, hanem mintha értené, miről beszélünk.
Befagyott tudás, élő kontextus
Minden modellnek van egy dátuma, ameddig olvasott. Az ezt követő világról semmit nem tud, hacsak nem kapja meg külön. Ha ennek nem vagy tudatában, könnyű félreérteni, mikor lehet rá támaszkodni. Egy egyszerű kettéosztás eldönti.
„Mit ír a mi 2024-es szerződésünk az X céggel a felmondási határidőről?" A modell sosem olvasta a szerződésedet. Vagy „nem tudom"-ot mond, vagy ami rosszabb: hallucinál egy jól hangzó, de hamis paragrafust.
„Mi a magyar Polgári Törvénykönyv általános szabálya a felmondási határidőre, és milyen tényezőktől függ?" Ezt olvasta, sokszor. Strukturált, pontos választ ad. Innen indulj, és onnan kérdezz tovább a saját kontextusoddal.
A különbség egyetlen kifejezésen múlik: be tudod-e tenni a kontextusba, amit a modellnek tudnia kell. Be lehet másolni: PDF, e-mail, dokumentum, szerződés, riport-CSV. Be lehet kötni: a modell connectoron keresztül eléri a céges Drive-ot, a Slacket, a Gmailt, a Notion-t (lásd a 4. modult). És be lehet automatizálni: egy keresőrendszer megtalálja a releváns dokumentumokat, és a modell ezekből építi a választ. Ezt hívják retrieval augmented generation-nek, röviden RAG-nek.
Innentől kezdve az AI értéke a saját szervezetedben azon múlik, hogy mennyire jól tudod kontextusba helyezni a feladatot. Ezért fogjuk a következő modul nagy részét a kontextus-kezelésnek szentelni.
A fekete doboz fél-fekete
A nyilvánosság szereti azt mondani, hogy „senki nem tudja, hogyan működik ez". Ez féligaz. Az egyes válaszok belső útját tényleg nem lehet utólag visszafejteni, hogy pontosan miért épp ezt mondta. Az alapelvek viszont ismerősek, és a lecke minden szakasza ezekre épült: predikció token szinten, attention a kontextus-ablakra, tanítás és használat szétválasztva, paraméter mátrixokban tárolva, a tokenek vektorként mozognak a sokdimenziós térben. Ami fekete a dobozban, az a részlet, a logikája megismerhető.
Hogy mit nem tud a modell, ezt egy mondatban is ki lehet mondani. Nincs benne logikai motor: nem ellenőrzi a saját következtetését. Nincs benne valóság-modell: nem tudja megmondani, hogy egy állítása igaz-e a fizikai világban. Nem néz frissen az internetre, csak ha külön eszközt kap rá. Numerikusan gyenge: nagy számokat rosszul szoroz, ezért adunk neki kalkulátor-eszközt. A reasoning modellek úgy tűnik, mintha gondolkodnának, és valóban hozzáadják a saját levezetésüket a kontextushoz, de a mechanizmus alapja ugyanaz: előre jósolt token, sokszor egymás után, csak most a saját gondolataival is.
„Ha valami jól megjósolja a következő tokent, az azt jelenti, hogy megérti azt a valóságot, ami az adott token létrejöttéhez vezetett."ILYA SUTSKEVER · OPENAI TÁRSALAPÍTÓ, VOLT VEZETŐ KUTATÓ · DWARKESH PODCAST
A „banálisan hangzik, mégsem az" érzés pontosan ez: egy egyszerű mechanizmus egyszer csak világmodellt kezd hordozni magában. A token-prediktálás alapmechanizmusa lényegében egyszerű. De ha elég adatot, elég paramétert és a kontextus-ablak attention-mechanizmusát egymásra rakod, olyan kombináció jön ki belőle, amilyet ritkán látni egyben. Ezért tartsd a fejedben a négy fogalmat. Aki ezen átment, az nem várja a modelltől, hogy mindentudó legyen, és nem is becsüli alá, mintha buta lenne. Pontosabban tudja, mit kérhet tőle, és mit nem.
Ellenőrizd magad: három kérdés
Két visszakérdezés, egy önreflexió. Nincs pontszám, nincs vizsga. A válaszaid a böngészőben maradnak.
Egyetlen mondatban: mit csinál a modell, amikor választ generál neked?
A b) helyes. A lecke „A predikció" szakasza ezt fejti ki: minden válasz token-lánc, mindegyik tokent egy valószínűségi eloszlásból választja a modell. Az a) téves, mert a modellben nincs klasszikus logikai motor. A c) téves, mert a modell előre tanult paraméterekből jósol, internetes keresés nélkül. A d) téves, mert a működés statisztikai mintaillesztés, nem agy-szimuláció.
A modell egy cégspecifikus kérdésre (pl. „mit ír a mi szerződésünk az X céggel?") kontextus nélkül miért nem ad jó választ?
A c) helyes. A „Befagyott tudás, élő kontextus" szakasz ezt mondja ki: az LLM csak azt tudja, amit a tanítása alatt olvasott. A te belső dokumentumaid nem voltak benne, ezért kontextus nélkül vagy „nem tudom"-ot mond, vagy hallucinál. A megoldás: be kell másolni az adatot, vagy connector / RAG be kell kötni az élő forrást.
Idézz fel egy konkrét helyzetet, amikor egy modellel beszélgetve láthatóan hallucinált. Mit állított, és visszanézve milyen kontextus hiányzott neki ahhoz, hogy ne ezt mondta volna?
egy mondat, magadnak
Három frontier szállító verseng egymással, és mindegyiknél három méret közül választhatsz. Megnézzük, mit mire válassz, és miért éri meg rugalmasnak maradni.