Miről szól ez a lecke: a legfontosabb pontok

  1. Az AI régóta velünk van, csak nem hívtuk így. Spam-szűrő, banki csaláselkerülés, ajánlórendszer, fordító, mind AI. Ami most új, az a generatív AI.
  2. Négy korszak rakódott egymásra: expert system (szabály) → machine learning (példa) → deep learning (sok réteg) → generatív AI (létrehozás). A régiek a helyükön maradtak, csak alulra kerültek a rétegekben.
  3. A 2017-es transformer oldotta meg, hogy a gép óriási szöveg-corpuson, gyorsan, párhuzamosan tanuljon. A GPT betűszó ennek a megfejtése: Generative Pre-trained Transformer.
  4. A tempó az új: ChatGPT (2022) és reasoning (2024) két ugrás két év alatt. Ami régen egy évtized volt, az ma egy-két év. A tervezési ciklusod ehhez igazodjon.

Ha ma „AI"-t mondunk, a legtöbb ember ChatGPT-re vagy Claude-ra gondol. Ez tényleg új jelenség, három éve még nem létezett. Az AI viszont, mint kutatási program és működő technológia, hetven éve közöttünk van. Az AI = ChatGPT. Ami most új, az pontosan a generatív AI, és ennek a megértéséhez kell egy hetven éves, négylépéses ív.

Az AI régóta velünk van, csak nem hívtuk így

A „mesterséges intelligencia" 1956 óta kutatási program. Az alapító generáció (John McCarthy, Marvin Minsky) az 1956-os Dartmouth-konferencián még azt várta, hogy 20 éven belül emberi szintű AI születik. Két AI-tél jött ehelyett: a 70-es évek (a finanszírozás kifutott), és a 90-esek (az „expert systems" üzletbe nem skálázódott). Mégis, az AI csendben terjedt az életünkben, hivatkozás nélkül.

Néhány hely, ahol már most körülöttünk van, és nem ChatGPT:

Banki csaláselkerülés
Minden tranzakciónál fut egy modell, ami azt mondja, „ez gyanús, vagy nem?" Klasszikus gépi tanulás.
Spam-szűrés
A Gmail naponta milliárdos nagyságrendben szűr leveleket ML-modellel, a 2004-es indulása óta egyre okosabban.
Netflix / Spotify ajánló
„Mit néznél meg legközelebb?" A platform megtanult a viselkedésedből.
Térkép-navigáció
A Google Maps becsült érkezése valós idejű forgalmi adatokon tanult modellből jön.
OCR és arcfelismerés
Útlevél-olvasó a reptéren, telefon-feloldás, dokumentum-szkennelés. Mind deep learning ma.
Beszéd-szöveg
Diktáfon, Siri, autós navi. Évtizedek óta finomodik, ma alig hibázik.

Amit eddig magától értetődőnek vettünk, az is mind AI. A klasszifikáció, a felismerés, a mintázat-keresés. Ami most új, és amitől robban a piac, az a létrehozás: a modell már új szöveget, képet, kódot, hangot generál, túl a felismerésen. Erről szól a következő szakasz.

A négy korszak, szabálytól a létrehozásig

Az AI fejlődése négy egymásra rakódó réteg. Mindegyik más logika, és mindegyik él még ma is, csak a legfelső réteg, a generatív AI az, amiről most az iparág beszél. A régiek a helyükön maradtak, csak rétegekre kerültek alulra.

hét évtized, négy korszak. a görbe a végén szakad fel.
01 klasszikus AI · 1956–2000 · szabályok kézzel 02 machine learning · 2000–2012 · példákból mintát 03 deep learning · 2012–2017 · sok rétegen át 04 generatív AI · 2017–ma · új tartalmat alkot
01
1956 – 2000
Expert system, szabályokból

Egy expert system szakértői szabályokból dolgozik: „ha láz > 38 °C ÉS köhögés, akkor influenza-gyanú". Egy ember leírja a logikát, a gép végrehajtja. Hozott látványos eredményt: 1997 IBM Deep Blue legyőzi Kaszparovot sakkban (kombinatorikus keresés és szakértői heurisztikák).

A korlátja egyértelmű: minden új problémához új szabályrendszer kell. Nem skálázódik. A 90-es évek végére az iparág belefáradt.

02
2000 – 2012
Machine learning, példákból

Megfordul a logika. Nem szabályt írunk, hanem rengeteg input → kimenet példát adunk, és a gép megtanulja a mintát. Ez a gépi tanulás. A banki csaláselkerülés, a spam-szűrő, az ajánlórendszer, a fordító mind ML-alapú. A modell több millió tranzakcióból megtanulja, mi a „normális", és mi gyanús.

A korlátja: a gép „mire figyeljen" kérdést emberek tervezik kézzel. A modell csak a megadott jellemzőkből (feature-ökből) tanul. Egy fejlesztő-szakértő gondol bele a feladat természetébe, és ő dönti el, melyek a fontos változók.

03
2012 – 2017
Deep learning, sok rétegen át

Itt a gép maga találja ki a fontos jellemzőket. Egy neurális háló sokrétegű, és minden réteg egy magasabb absztrakciót épít az előzőből. A „mély" (deep learning) a sok rétegre utal.

2012, ImageNet: Alex Krizhevsky deep learning modellje 10 százalékponttal veri a klasszikus képfelismerőket. Az AI-történet legtisztább áttörés-pillanata. 2016, AlphaGo (DeepMind) legyőzi Lee Sedolt Go-ban, ami brute-force-szal nem megoldható, valódi tanulás kellett.

A 2010-es években három dolog jött össze: rengeteg adat (internet, social media), olcsó GPU-k (a gaming-piac fejlesztette ki), és a sokrétegű architektúrák hatékony tanítási módszerei. Ettől robbant be a deep learning. Mai DL-alkalmazások: arcfelismerés, beszéd-szöveg, képkeresés, autonóm vezetés.

04
2017 –
Generatív AI, a létrehozás

A generatív AI a deep learning egy speciális ága, ami a kimenet oldalán új tartalmat hoz létre: szöveg, kép, kód, hang. A különbség ennyi, és ennyi elég. Az előző három korszakban a gép felismert és klasszifikált, itt kezd létrehozni.

Hogy ez hogyan vált lehetségessé, egyetlen 8 oldalas tanulmányra vezethető vissza. A következő szakasz erről szól.

A Google Translate-sztori, és hogyan született a GPT

Emlékeztek, milyen szörnyű volt a Google Translate tíz éve? Szóról szóra fordított, magyarból gyakran értelmetlen mondatokat adott. Ez volt a klasszikus szabály-alapú és statisztikai gépi fordítás kora, és nagyon látható korlátja volt. A Google a saját termékét akarta jobbá tenni, a kutatóik ebből indultak el.

2016 november: a Google átállt GNMT-re (Google Neural Machine Translation), egy deep-learning alapú LSTM-architektúrára. Egyik napról másikra látható ugrás minőségben. Ez volt a „mi történt itt?" pillanat, pedig a motorháztető alatt még deep learning dolgozott a régi, szekvenciális logikával. A transformer csak 2017-ben érkezett.

2017 június, Google Brain. Nyolc kutató (Vaswani és társai) publikálja az Attention Is All You Need című 8 oldalas tanulmányt. Új neurális architektúrát javasolnak: transformer. Az újdonsága: nem szóról szóra (szekvenciálisan) dolgozza fel a szöveget, hanem párhuzamosan, és minden szó figyelmét súlyozottan osztja el a kontextus minden korábbi szavára. Ezt hívják attention-mechanizmusnak.

Két következménye lett, ami a mai LLM-világot megalapozta: sokkal gyorsabban tanítható óriási adathalmazon (mert párhuzamos), és sokkal nagyobb adattal feltanítható ugyanannyi gép-órában. A Google először a saját Translate-jébe építette be (2018-tól, fokozatosan, 2020-ra teljes átállás), de addigra már mások is felfigyeltek a tanulmányra.

A különbséget egyetlen képben így a legkönnyebb látni. A régi modell egy mondatot szó-szó-szó láncként olvasott. Mire a negyedik szóhoz ért, az elsőre már alig emlékezett. A transformer ehelyett az egész mondatot egyszerre veszi a kezébe, és minden szót minden másikkal összekapcsol egy figyelem-súlyon át.

régi: szó-szó láncolat. új: minden szó minden másikkal.

Aidan Gomez, a transformer-papír egyik társszerzője (ma a Cohere CEO-ja) így mesélte el a Verge-nek, milyen volt a kísérletet belülről nézni. A korai modell a Wikipédián tanult, semmi máson:

Computers could barely string a sentence together properly. Nothing they wrote made sense. There were spelling mistakes. It was just a lot of noise. And then, suddenly one day, we kind of woke up, sampled from the model, and it was writing entire documents as fluently as a human. That just came as this huge shock to me.
AIDAN GOMEZ · THE VERGE · 2024

2018-2019, az OpenAI átveszi a transformert. Felteszi a kérdést: ha hatalmas szöveg-corpuson előre tanítunk egy transformert, és csak utána finomhangoljuk egy konkrét feladatra, milyen messzire jut? Ezt a receptet hívják pre-trainingnek, és innen jön a GPT betűszó:

T Transformer, a 2017-es Google Brain architektúra
P Pre-trained, óriási szöveg-adathalmazon előre tanítva
G Generative, új tartalmat hoz létre
visszafelé olvasva   ↓
G P T

2019, GPT-2. Az OpenAI a transformer + pre-training receptet egy nagyobb skálán futtatja. Az eredmény annyira meggyőzően összefüggő szöveget generált, hogy az OpenAI eredetileg „túl veszélyesnek" tartotta közzétenni, és csak egy kis verziót adott ki. A teljes release csak novemberben jött. Ez volt az első széles körben látható jelzés, hogy ami a Google Brain-nél „megszólalt", az nem fog megállni.

2022 és 2024, két ugrás két év alatt

Ahol most állunk, az két ugrás két év alatt. Az első 2022-ben hozta el a chat-korszakot, ekkor jutott el a generatív AI az emberek kezéig. A második 2024 őszén a reasoning modelleket, ahol a modell egy belső szakaszban végiggondolja a választ. A mai sebesség mindkettő ismerete nélkül érthetetlen.

2022.11.30, ChatGPT. Az első, hogy egy LLM jól néz ki egy hétköznapi felhasználónak. 100 millió felhasználó 2 hónap alatt. Történelmi rekord. 2023-2024 a modellek megbízhatóbbak lesznek (GPT-4, Claude 3, Gemini), de a paradigma még mindig „chat-completion": egy kérdés be, egy válasz ki.

2024 ősztől, reasoning modellek. Először az OpenAI o1, utána sorra minden szállító saját reasoning-vonala. A modell magában végig-gondolkodik a problémán, mielőtt válaszol. Belül „gondolat-tokeneket" generál, amiket a felhasználó nem lát. Ha a modell egy kérdésre 30 másodpercet gondolkodik egy helyett, az 30× több compute, és azonos képesség mellett drámaian pontosabb választ ad. Ez az, amit „inference-compute"-nak hívnak (lásd az első modul infrastruktúra-részét).

A tempó az, ami most más, mint bármikor korábban. Az ugrások sűrűsödnek:

Vezetőként ez nem azt jelenti, hogy minden release után kapkodni kell. Inkább azt, hogy a tervezési ciklusod legyen rövidebb, mint a modell-generációs ciklus. Aki ma kétéves AI-stratégiát rak össze, a stratégiát fél év alatt utoléri a piac.

Ellenőrizd magad: három kérdés

Két visszakérdezés, egy önreflexió. Nincs pontszám, nincs vizsga. A válaszaid a böngészőben maradnak.

01
visszakérdezés

Mi a fő különbség a klasszikus machine learning (pl. banki csaláselkerülés) és a generatív AI (pl. ChatGPT) között?

02
visszakérdezés

Mit jelent a GPT betűszó?

03
önreflexió

A saját szervezetedben hol használtok már most AI-t anélkül, hogy generatív AI lenne? (Pl. spam-szűrő, csalás-detektor, ajánlórendszer, OCR, fordítás.) Mi az, amit eddig magától értetődőnek vettél, de visszanézve „ez is AI"?

egy mondat, magadnak

Mentve.
a lecke-térképen csak akkor lesz zöld pipa, ha mindhárom megvan
KÖVETKEZŐ LECKE · L2.2
Mi van a fekete dobozban? →

A modell nem mágia és nem mesterséges agy. Egy következő-token-prediktor egy sokdimenziós térben. Megérted a működését matek nélkül, és a saját használatod azonnal jobb lesz.