Miről szól ez a lecke: a legfontosabb pontok
- Az AI régóta velünk van, csak nem hívtuk így. Spam-szűrő, banki csaláselkerülés, ajánlórendszer, fordító, mind AI. Ami most új, az a generatív AI.
- Négy korszak rakódott egymásra: expert system (szabály) → machine learning (példa) → deep learning (sok réteg) → generatív AI (létrehozás). A régiek a helyükön maradtak, csak alulra kerültek a rétegekben.
- A 2017-es transformer oldotta meg, hogy a gép óriási szöveg-corpuson, gyorsan, párhuzamosan tanuljon. A GPT betűszó ennek a megfejtése: Generative Pre-trained Transformer.
- A tempó az új: ChatGPT (2022) és reasoning (2024) két ugrás két év alatt. Ami régen egy évtized volt, az ma egy-két év. A tervezési ciklusod ehhez igazodjon.
Ha ma „AI"-t mondunk, a legtöbb ember ChatGPT-re vagy Claude-ra gondol. Ez tényleg új jelenség, három éve még nem létezett. Az AI viszont, mint kutatási program és működő technológia, hetven éve közöttünk van. Az AI = ChatGPT. Ami most új, az pontosan a generatív AI, és ennek a megértéséhez kell egy hetven éves, négylépéses ív.
Az AI régóta velünk van, csak nem hívtuk így
A „mesterséges intelligencia" 1956 óta kutatási program. Az alapító generáció (John McCarthy, Marvin Minsky) az 1956-os Dartmouth-konferencián még azt várta, hogy 20 éven belül emberi szintű AI születik. Két AI-tél jött ehelyett: a 70-es évek (a finanszírozás kifutott), és a 90-esek (az „expert systems" üzletbe nem skálázódott). Mégis, az AI csendben terjedt az életünkben, hivatkozás nélkül.
Néhány hely, ahol már most körülöttünk van, és nem ChatGPT:
Amit eddig magától értetődőnek vettünk, az is mind AI. A klasszifikáció, a felismerés, a mintázat-keresés. Ami most új, és amitől robban a piac, az a létrehozás: a modell már új szöveget, képet, kódot, hangot generál, túl a felismerésen. Erről szól a következő szakasz.
A négy korszak, szabálytól a létrehozásig
Az AI fejlődése négy egymásra rakódó réteg. Mindegyik más logika, és mindegyik él még ma is, csak a legfelső réteg, a generatív AI az, amiről most az iparág beszél. A régiek a helyükön maradtak, csak rétegekre kerültek alulra.
Egy expert system szakértői szabályokból dolgozik: „ha láz > 38 °C ÉS köhögés, akkor influenza-gyanú". Egy ember leírja a logikát, a gép végrehajtja. Hozott látványos eredményt: 1997 IBM Deep Blue legyőzi Kaszparovot sakkban (kombinatorikus keresés és szakértői heurisztikák).
A korlátja egyértelmű: minden új problémához új szabályrendszer kell. Nem skálázódik. A 90-es évek végére az iparág belefáradt.
Megfordul a logika. Nem szabályt írunk, hanem rengeteg input → kimenet példát adunk, és a gép megtanulja a mintát. Ez a gépi tanulás. A banki csaláselkerülés, a spam-szűrő, az ajánlórendszer, a fordító mind ML-alapú. A modell több millió tranzakcióból megtanulja, mi a „normális", és mi gyanús.
A korlátja: a gép „mire figyeljen" kérdést emberek tervezik kézzel. A modell csak a megadott jellemzőkből (feature-ökből) tanul. Egy fejlesztő-szakértő gondol bele a feladat természetébe, és ő dönti el, melyek a fontos változók.
Itt a gép maga találja ki a fontos jellemzőket. Egy neurális háló sokrétegű, és minden réteg egy magasabb absztrakciót épít az előzőből. A „mély" (deep learning) a sok rétegre utal.
2012, ImageNet: Alex Krizhevsky deep learning modellje 10 százalékponttal veri a klasszikus képfelismerőket. Az AI-történet legtisztább áttörés-pillanata. 2016, AlphaGo (DeepMind) legyőzi Lee Sedolt Go-ban, ami brute-force-szal nem megoldható, valódi tanulás kellett.
A 2010-es években három dolog jött össze: rengeteg adat (internet, social media), olcsó GPU-k (a gaming-piac fejlesztette ki), és a sokrétegű architektúrák hatékony tanítási módszerei. Ettől robbant be a deep learning. Mai DL-alkalmazások: arcfelismerés, beszéd-szöveg, képkeresés, autonóm vezetés.
A generatív AI a deep learning egy speciális ága, ami a kimenet oldalán új tartalmat hoz létre: szöveg, kép, kód, hang. A különbség ennyi, és ennyi elég. Az előző három korszakban a gép felismert és klasszifikált, itt kezd létrehozni.
Hogy ez hogyan vált lehetségessé, egyetlen 8 oldalas tanulmányra vezethető vissza. A következő szakasz erről szól.
A Google Translate-sztori, és hogyan született a GPT
Emlékeztek, milyen szörnyű volt a Google Translate tíz éve? Szóról szóra fordított, magyarból gyakran értelmetlen mondatokat adott. Ez volt a klasszikus szabály-alapú és statisztikai gépi fordítás kora, és nagyon látható korlátja volt. A Google a saját termékét akarta jobbá tenni, a kutatóik ebből indultak el.
2016 november: a Google átállt GNMT-re (Google Neural Machine Translation), egy deep-learning alapú LSTM-architektúrára. Egyik napról másikra látható ugrás minőségben. Ez volt a „mi történt itt?" pillanat, pedig a motorháztető alatt még deep learning dolgozott a régi, szekvenciális logikával. A transformer csak 2017-ben érkezett.
2017 június, Google Brain. Nyolc kutató (Vaswani és társai) publikálja az Attention Is All You Need című 8 oldalas tanulmányt. Új neurális architektúrát javasolnak: transformer. Az újdonsága: nem szóról szóra (szekvenciálisan) dolgozza fel a szöveget, hanem párhuzamosan, és minden szó figyelmét súlyozottan osztja el a kontextus minden korábbi szavára. Ezt hívják attention-mechanizmusnak.
Két következménye lett, ami a mai LLM-világot megalapozta: sokkal gyorsabban tanítható óriási adathalmazon (mert párhuzamos), és sokkal nagyobb adattal feltanítható ugyanannyi gép-órában. A Google először a saját Translate-jébe építette be (2018-tól, fokozatosan, 2020-ra teljes átállás), de addigra már mások is felfigyeltek a tanulmányra.
A különbséget egyetlen képben így a legkönnyebb látni. A régi modell egy mondatot szó-szó-szó láncként olvasott. Mire a negyedik szóhoz ért, az elsőre már alig emlékezett. A transformer ehelyett az egész mondatot egyszerre veszi a kezébe, és minden szót minden másikkal összekapcsol egy figyelem-súlyon át.
Aidan Gomez, a transformer-papír egyik társszerzője (ma a Cohere CEO-ja) így mesélte el a Verge-nek, milyen volt a kísérletet belülről nézni. A korai modell a Wikipédián tanult, semmi máson:
Computers could barely string a sentence together properly. Nothing they wrote made sense. There were spelling mistakes. It was just a lot of noise. And then, suddenly one day, we kind of woke up, sampled from the model, and it was writing entire documents as fluently as a human. That just came as this huge shock to me.AIDAN GOMEZ · THE VERGE · 2024
2018-2019, az OpenAI átveszi a transformert. Felteszi a kérdést: ha hatalmas szöveg-corpuson előre tanítunk egy transformert, és csak utána finomhangoljuk egy konkrét feladatra, milyen messzire jut? Ezt a receptet hívják pre-trainingnek, és innen jön a GPT betűszó:
2019, GPT-2. Az OpenAI a transformer + pre-training receptet egy nagyobb skálán futtatja. Az eredmény annyira meggyőzően összefüggő szöveget generált, hogy az OpenAI eredetileg „túl veszélyesnek" tartotta közzétenni, és csak egy kis verziót adott ki. A teljes release csak novemberben jött. Ez volt az első széles körben látható jelzés, hogy ami a Google Brain-nél „megszólalt", az nem fog megállni.
2022 és 2024, két ugrás két év alatt
Ahol most állunk, az két ugrás két év alatt. Az első 2022-ben hozta el a chat-korszakot, ekkor jutott el a generatív AI az emberek kezéig. A második 2024 őszén a reasoning modelleket, ahol a modell egy belső szakaszban végiggondolja a választ. A mai sebesség mindkettő ismerete nélkül érthetetlen.
2022.11.30, ChatGPT. Az első, hogy egy LLM jól néz ki egy hétköznapi felhasználónak. 100 millió felhasználó 2 hónap alatt. Történelmi rekord. 2023-2024 a modellek megbízhatóbbak lesznek (GPT-4, Claude 3, Gemini), de a paradigma még mindig „chat-completion": egy kérdés be, egy válasz ki.
2024 ősztől, reasoning modellek. Először az OpenAI o1, utána sorra minden szállító saját reasoning-vonala. A modell magában végig-gondolkodik a problémán, mielőtt válaszol. Belül „gondolat-tokeneket" generál, amiket a felhasználó nem lát. Ha a modell egy kérdésre 30 másodpercet gondolkodik egy helyett, az 30× több compute, és azonos képesség mellett drámaian pontosabb választ ad. Ez az, amit „inference-compute"-nak hívnak (lásd az első modul infrastruktúra-részét).
A tempó az, ami most más, mint bármikor korábban. Az ugrások sűrűsödnek:
- Dartmouth → Deep Blue41 év
- Deep Blue → ImageNet15 év
- ImageNet → ChatGPT10 év
- ChatGPT → reasoning2 év
- reasoning → agentic coding~1 év
- agentic coding → következő szintfolyamatban
Vezetőként ez nem azt jelenti, hogy minden release után kapkodni kell. Inkább azt, hogy a tervezési ciklusod legyen rövidebb, mint a modell-generációs ciklus. Aki ma kétéves AI-stratégiát rak össze, a stratégiát fél év alatt utoléri a piac.
Ellenőrizd magad: három kérdés
Két visszakérdezés, egy önreflexió. Nincs pontszám, nincs vizsga. A válaszaid a böngészőben maradnak.
Mi a fő különbség a klasszikus machine learning (pl. banki csaláselkerülés) és a generatív AI (pl. ChatGPT) között?
A b) helyes. A klasszikus ML feladata felismerés vagy döntés („ez a tranzakció gyanús-e?", „ez a kép macska-e?"). A generatív AI ehhez képest új tartalmat hoz létre (szöveg, kép, kód, hang). Mindkettő deep learning lehet, de a kimenet típusa teszi élesen különbözővé őket.
Mit jelent a GPT betűszó?
A c) helyes. Generative, új tartalmat hoz létre. Pre-trained, óriási adathalmazon (gyakorlatilag az internet jelentős részén) előre tanítva. Transformer, a 2017-es Google Brain architektúra, ami párhuzamos figyelem-mechanizmussal lecserélte a szekvenciális szövegfeldolgozást. A három együtt adta a mai LLM-eket.
A saját szervezetedben hol használtok már most AI-t anélkül, hogy generatív AI lenne? (Pl. spam-szűrő, csalás-detektor, ajánlórendszer, OCR, fordítás.) Mi az, amit eddig magától értetődőnek vettél, de visszanézve „ez is AI"?
egy mondat, magadnak
A modell nem mágia és nem mesterséges agy. Egy következő-token-prediktor egy sokdimenziós térben. Megérted a működését matek nélkül, és a saját használatod azonnal jobb lesz.