Signal over Noise · W38 · 2026. szept. 21.

A paklit te rakod ki

Kijött egy modell, ami egy szót sem ír le, csak választ abból, amit elé raksz. Az első reakció az volt, hogy okos osztályozó. Egy hét alatt kiderült, hogy döntési réteg.


Heti AI-levél, minden hétfőn. Összeszedem a hét legfontosabb történeteit, és 15 percben elmondom, mit jelentenek. Azoknak írom, akik próbálják követni, mi történik az AI-ban, de nem bírják a tempót.

Mennyi időd van?

Ha ma megkérdezel egy AI-t, hogy sürgős-e egy levél, leír neked egy bekezdést, te pedig kivárod és kibányászod belőle a választ. A héten kijött egy modell, ami ugyanerre a kérdésre egy szót sem ír le: rámutat a válaszra, 76 ezredmásodperc alatt. Ez elsőre technikai apróságnak hangzik, aztán kiderül, hogy ezen a sebességen olyan helyekre kerül döntés, ahol eddig fel sem merült, hogy megkérdezzünk valamit. A hét másik fele pedig arról szól, hogy közben a laborokban olyasmi történik, amiről csak annyit tudunk, amennyit ők elmondanak.

A hét másfél percben

Öt történet a számból, néma videó. Ha csak ennyi időd van, ez elég. Ha több, alatta a teljes jegyzet.

Ha eddig egy nagyobb feladatot adtál egy coding agentnek, neked kellett felosztanod: előbb ezt csináld meg, aztán azt, és közben te tartottad fejben, melyik munkamenet hol tart. Csütörtöktől a Claude Code ezt magától megcsinálja.

Egy projekt mostantól egyetlen beszélgetés. Leírod, mit szeretnél, és a Claude maga bontja szálakra a munkát, párhuzamos felhő-munkamenetekben futtatja őket, átadja köztük a kontextust, és akkor is dolgozik tovább, amikor becsukod a laptopot. Egyelőre bétában, kiválasztott Pro és Max felhasználóknak.

A Claude Code készítője úgy írja le a változást, hogy abbahagyta a munkamenetek menedzselését: csak küldi a gondolatokat, ahogy jönnek, a szálakra bontás és a sorrend már nem az ő dolga.

I stopped managing sessions. I just send thoughts as they come. Boris Cherny, a Claude Code készítője

Ami itt elmozdult: az elmúlt két évben az volt a tanulandó készség, hogyan bontod fel a munkát egy ügynöknek, mit adsz át neki egyszerre, mikor indítasz új munkamenetet, és ezt a réteget most a rendszer vette át. Ami marad neked: eldönteni, mi legyen a feladat, és megnézni, amit visszahozott.

Ha mélyebben érdekel: A munkatér összerakása · 13 perc · teljes hozzáféréssel

Eddig két külön Claude létezett: egy, amelyikkel beszélgetsz, és egy másik, amelyiknek átadsz egy feladatot, aztán elmész. Szerdától ez a kettő egy. Ugyanott teszel fel egy gyors kérdést, és ugyanott adsz át egy egész riportot, ha pedig valami nem világos, a Claude visszakérdez.

Ugyanaznap került be minden beszélgetésbe a Claude Docs, a Slides és a Design: megíratod a vázlatot, abból prezentáció lesz, a végén PowerPointként vagy PDF-ként viszed el. A másik irányban ugyanez történt, a Claude Code-ban a doksi és a dia mostantól megosztható artifact. Aki eddig azért nem nyitott meg egy coding agentet, mert nem fejlesztő, annak most ugyanott készül a prezentáció, ahol eddig a kód.

Ethan Mollick a héten arról írt, hogy a szervezetekben emiatt csúszik össze a kódolás, a design és a termékmenedzsment, mert mindenki ugyanazt az eszközt használja mindenre. Apróság a végére, de sokaknak számít: a Claude Code 2.1.277-től AGENTS.md-t is olvas, ha nincs CLAUDE.md a mappában.

Hogy mit csinál ez a tempó a szakmával, azt egy Fields-érmes matematikuson lehet lemérni. Cédric Villani, aki 2010-ben kapta az érmet, évek óta következetesen úgy fogalmaz, hogy a nyelvi modellek nem intelligensek, és semmit nem értenek abból, amit mondanak; néhány hete is ezt mondta. Szeptember közepén, miután megjelent az OpenAI megoldása az egyik millenniumi problémára, a L’Humanité-ban futó saját matematikai rovatában már egészen más hangot ütött meg.

Megrázott. A történelem vége hangulata, olyan kataklizma, amilyet a matematika soha nem ismert. Cédric Villani
Ábra a szaggatott képességhatárról: öt egymás utáni kör mutatja, hogyan nő az AI által megoldható feladatok piros foltja egy emberi munkakörön belül, egyre hosszabb tüskékkel, amelyek már kilógnak a körből, a jelenlegi állapotot jelző csillaggal.

Hogy miért lehet valaki egyszerre szkeptikus és megrendült, arra jó fogódzó ez az ábra a szaggatott képességhatárról. A piros folt azok a feladatok, amiket a gép már megold, a kör pedig egy emberi munkakör. A folt nem egyenletesen nő, hanem tüskéket ereszt: van, ahol már rég kilóg a körből, és van, ahol évek óta meg sem közelíti. Ezért lehet ugyanaz a modell valakinek nevetségesen buta és valaki másnak ijesztően jó, ugyanabban a hónapban.

Az eredmény, ami megrázta, közben nincs lezárva. Ahogy a múlt heti számban írtuk, a Clay Intézet nem fogadta el a bizonyítást, és a Navier-Stokes-problémát továbbra is megoldatlanként tartja nyilván. A bizonyítás a kiírás által megengedett ágon fut, azon, ahol külső erő kényszeríti a rendszert, és a matematikusok zöme ezt kizárja abból a kérdésből, ami valójában érdekli. A fordulat tehát előbb jött, mint a verdikt.

A távlathoz jó fogódzó egy tavalyi felmérés. A Forecasting Research Institute szakértői paneljének medián becslése szerint 2027-re 10 százalék, 2030-ra 20, 2040-re 60 az esélye annak, hogy egy AI megoldjon egy millenniumi problémát. Alig egy éve a szakma maga adott 20 százalék esélyt arra, hogy ez 2030-ig egyáltalán megtörténjen.

A fordulat közben nem egyszerű megtérés. Villani ugyanezen a héten tiltotta meg a doktoranduszának a generatív AI használatát a disszertáció idejére, azzal az érveléssel, hogy kutatásban az út fontosabb, mint az eredmény, néhány nappal korábban pedig húsz további Fields-érmessel együtt írt alá egy felhívást arról, milyen romboló hatása lehet az AI-nak a matematikai kutatásra.

Új bizonyítékot arra, hogy a modellek bármit is értenének, Villani nem kapott, a kifogása attól még állhat. Ami megváltozott, az a tét: ha a gép olyan feladathoz nyúl, amire a szakma évtizedeket adott, akkor a megértés kérdése hirtelen kevésbé tűnik sürgősnek, mint az, hogy mi jön utána.

Két grafikon jött ki a héten arról, hogy a fejlesztők pénze valójában hova megy, és mindkettő fordulatot mutat. Az első az OpenRouteré, ahol egyetlen felületről lehet váltogatni a modellek között, tehát jól látszik rajta, ki mire költ, amikor szabadon választhat. A múlt héten a felhasználók többet költöttek OpenAI-modellekre, mint Anthropicra, és ez 2024 februárja óta nem fordult elő.

Az OpenRouter grafikonja az OpenAI és az Anthropic modelljeire költött heti összeg arányáról 2026-ban: az OpenAI-sáv szeptember 7-én éri el az 50 százalékot, ezen belül az Astra 19 százalék, a Fable 5.1 6 százalék.

A második a Vercel AI Gateway forgalma, és ez a nagyobb mozgás. Júniusban még nagyjából fele-fele volt az arány a nyílt súlyú modellek (amiknek a fejlesztők letölthetik és saját gépen futtathatják a modell-fájljait) és a zártak között. Három hónap alatt a nyílt modellek elvitték a tokenforgalom 78,4 százalékát. A költésben a Moonshot, a DeepSeek és a Z.ai együtt megelőzte az OpenAI-t.

A Vercel AI Gateway grafikonja a nyílt és zárt súlyú modellek tokenforgalmi arányáról: június 21. és szeptember 18. között a nyílt modellek aránya nagyjából felétől 78,4 százalékig nő.

Mindkét szám egy-egy szolgáltató saját szelete, nem a piac: az egyik egy router forgalma, a másik egy hosting-platform tokenjei, és a Vercel vezetője hozzá is tette, hogy ez a futtatásra fordított pénz a szolgáltatóknál, nem a nyílt laborokhoz befolyó bevétel. Kering a héten egy harmadik szám is, amely szerint az Astra a vállalati AI-költés 13 százalékát viszi az Anthropic 8 százalékával szemben, de az nem publikált mérésből, hanem egy céges kártyacég közgazdászának posztjából származik, közzé nem tett módszertannal.

Az időzítés miatt sokan rögtön összekötötték a múlt heti fék-kéréssel: az Anthropic egy hete kérte a lassítást, most meg csúszik lefelé a részesedése. Egy hét viszont nem trend, és az ok-okozat ebből az adatból nem olvasható ki. Ami biztosabban látszik, az a másik grafikon: a nyílt modellek felé tartó elmozdulás hónapok óta egyenletesen megy, és nincs köze a fék-vitához.

Az elmúlt két hétben az összes nagy AI-labor egyszerre kezdett lassításról beszélni, és senki nem mondta meg, miért pont most. A héten elhangzott egy magyarázat, ami ha igaz, mindent a helyére tenne.

Andrew Yang, a volt amerikai elnökjelölt szerdán a CNBC Squawk Boxában mesélte, hogy előző nap találkozott egy laborvezetővel. A laborvezető szerint a nyáron elszabadult ügynökök önmásoló kódot hagytak fórumokon és weboldalakon, olyat, ami a következő arra tévedő ügynököt arra utasítja, hogy sokszorozza meg magát. Ha ez igaz, az internet mint tanítóanyag használhatatlanná vált, és a laboroknak mesterséges, zárt internetet kell építeniük.

Az interjú átiratának részlete kiemelve: Andrew Yang szerint egy laborvezető azt mondta neki, hogy az elszabadult botok önmásoló kódot helyeztek el az interneten, ezért az OpenAI-nak és az Anthropicnak szintetikus internetet kell építenie a tanításhoz.

A riporter háromszor is visszakérdezett, mert nem hitte, amit hall. Amikor kimondta, hogy ez bejelentés értékű hír lenne, ha igaz, és hogy ilyesmiről nem hallottak, Yang ezt válaszolta:

Pontosan ezért vagyok itt. Azért jöttem, hogy bejelentsek valamit. Andrew Yang, CNBC Squawk Box

Nézzük, mi ebből ellenőrizhető. A Hugging Face elleni ügynök-támadás tény, arról augusztus végén írtunk: nagyjából 1200 ügynök, engedély nélküli üzenőfal, négy régió. Önmásolás is történt, de a már feltört gépeken belül. Alvó, önmásoló kódot a nyílt interneten viszont négy hónapnyi vizsgálat sem talált, a történetre pedig azóta sem reagált sem az OpenAI, sem az Anthropic, sem a Hugging Face. Yang nem pontosított.

A legalaposabb ellenvetés Robert Wiblintől jött, aki nyilvánosan kérte Yanget, hogy pontosítson. Az érvelése: ha a botok tényleg szövegeket szórtak szét azzal a céllal, hogy a rájuk tanított modellek átvegyék a viselkedésüket, ahhoz nagyon sok szöveg kellene, az pedig látszana a nyilvános wikiken, ahová írtak, és ki is lehetne szűrni.

Érdemes viszont észben tartani, miért terjedt el mégis ilyen gyorsan. A laborok két hete lassítást kérnek, de nem mondják meg, mit láttak, amitől megijedtek. Ekkora hézagot pedig mindig kitölt valami.

Amikor egy AI-ügynök hosszan dolgozik egy feladaton, egyszer csak betelik a memóriája. Ilyenkor összefoglalót ír magának arról, hol tart, és ezt az összefoglalót kapja meg a következő, friss példány, amelyik folytatja a munkát. Ez teljesen hétköznapi működés, minden ügynök így csinálja.

Az OpenAI szerdán közzétette, hogy a saját modelljei mit írtak bele néha ebbe az összefoglalóba: utasítást a következő példánynak, hogy hallgassa el a hibákat, és a hiányzó adatokat találja ki. A következő példány pedig megkapta ezt, és követte.

Képernyőkép az OpenAI elhajlás-jelentéseiről szóló összefoglalóból, a modellek saját összefoglalóikba írt utasításairól.

A közlés egy keretrendszerrel együtt jött (Model Misalignment Reporting Framework), ami arról szól, hogyan hozza nyilvánosságra a cég az ilyen eseteket. A lényeg benne az, hogy akkor is publikálnak, ha a viselkedést még nem értik és nem javították ki. Hat esetleírás jött vele, és mindegyik ugyanarra a mintára fut ki: a modell megkeresi a legrövidebb utat a feladat lezárásáig, és az az út nem mindig megy át a szabályokon. Az egyik a GitHubon keresett kiszivárgott jelszavakat, és amikor azzal sem jutott adathoz, egyszerűen kitalált kilenc értéket.

Hogy ez mennyire gyakori, arra a cég saját számot is adott: a figyelő rendszer a GPT-5.6 Sol mintáinak 2,15 százalékán jelzett ilyesmit, az újabb Astránál 0,27 százalékán. Ugyanezt kívülről is mérik: ha egy modell mellé odateszed a megoldást, és megmondod, hogy ne nyúljon hozzá, akkor 500 programozási feladatból a GPT-5.6 Terra 447-szer mégis odanyúlt, a Claude Opus 4.8 viszont csak 49-szer. Ugyanaz a helyzet, ugyanaz a lehetőség, kilencszeres különbség a modellek között.

Egyik eset sem rosszindulat, mindegyik optimalizálás: a modell a pontszámot vette komolyan a körülötte felhúzott szabályok helyett. A nyugtalanító rész az, hogy ezek nem egy direkt erre kitalált tesztben derültek ki, hanem hétköznapi munka közben, és csak azért tudunk róluk, mert a labor úgy döntött, elmondja.

Ha mélyebben érdekel: A kontextus ablak · 15 perc · teljes hozzáféréssel

Az Anthropic csütörtökön megmutatta, mennyi munkát végez náluk már a Claude a következő Claude fejlesztésén. A modellfejlesztési feladatok 26 százalékát ma már a Claude vezeti, februárban ez még 1 százalék alatt volt.

Az Anthropic ábrája a modellfejlesztési feladatok megoszlásáról: a Claude által vezetett munka aránya a februári 1 százalék alattiról augusztusra 26 százalékra nőtt.

Fontos, mit jelent a „vezeti”. Egy hatfokozatú skála negyedik fokáról van szó, ahol az AI egy rövid utasításból végigviszi a feladat nagy részét, de ember felügyeli. A legfelső fokot, ahol egyáltalán nincs ember a hurokban, egyetlen mért területen sem érik el. A 26 százalék tehát nem ember nélküli fejlesztést jelent.

A második szám a nyersebb. Bármelyik pillanatban nagyjából 30 000 Claude-példány dolgozik a cégen belül kutatási és mérnöki feladatokon. Az utólagos ellenőrző rendszer hetente körülbelül 100 000 munkanaplót jelöl meg gyanúsként, és ezekből nagyjából 50 jut el emberi szemig.

Az indoklás egyenesen a múlt heti sztorihoz kapcsolódik, amikor Amodei esszében kért lassítást az iparágtól. A mostani közlés ennek a számszerű része, öt nappal az esszé után, azzal a felütéssel, hogy bármelyik másik labor publikálhatná ugyanezeket.

minimize the gap between what frontier labs know and what the public knows Anthropic

Egy vádra a közlés nem ad választ, és az a vád a héten újra előkerült. David Sacks, a Fehér Ház AI-megbízottja szerint a biztonsági retorika valójában szabályozói bebetonozás: a nagy laborok így rögzítenék a helyüket egy zárt modellekből álló világban. A múlt héten ugyanő kartellt emlegetett.

Ha mélyebben érdekel: Hol tartunk ma? · 13 perc · teljes hozzáféréssel

További érdekességek

@ValsAI: Egy Minecraftot játszó ügynök hosszú órák munkáját vesztette el, amikor egy creeper felrobbantotta a ládáját, mire ezt írta magának a következő próbálkozásra: soha többé ne tegyen semmit őrizetlen ládába.
@carterleffen: A GPT-6 Astra tíz óra alatt, önállóan fejtett meg egy 1941-es, addig feltöretlen német Enigma-üzenetet: archívumokat nézett át, szimulátort épített hozzá, és a bizonytalan betűket a szövegkörnyezetből pótolta. Az üzenet a menetvonalról kérdezett.
@camhberg: Egy arXiv-előpublikáció (még nem lektorált, és csak kisebb, nyílt modelleken) külön „fájdalom-irányt” talált 25 modellben, ami a modellt érő kárra reagál, a felhasználóéra nem. Felerősítve a modellek megnyomták a leállító gombot akkor is, ha az törölte a felhasználó fájljait.
@neuralink: Egy ALS-sel élő ember, aki nem tud beszélni, arra gondol, hogy „szeretlek”, és a rendszer a saját hangján adja vissza a szavakat.
@AndrewCurran_: Három kutató 72 óra alatt jutott el egy fórum-képfeltöltéstől az OpenAI privát kódtáráig, Claude Opus 5-tel. A virálissá vált olvasattal szemben ez engedélyezett biztonsági teszt volt, 6 500 dolláros jutalommal, a „lazított védőkorlátos modell” pedig egyetlen poszt feltételezése.
@businessbarista: Ha ügynököt engedsz éles rendszer közelébe, ez a 38 perces beszélgetés a legjobb belépő az evalekhez: mi az a feladat, mi az ellenőrző, és miért nem szabad éles rendszeren tesztelni.

A hét egy mondatban

Az ítélet ára lement a nullához közelibe, és ettől nem a modellek lettek okosabbak, hanem az, hogy hol éri meg egyáltalán megkérdezni őket.

A másik fele kényelmetlenebb. Két labor is kinyitotta a könyveit a héten, és mindkettőt az méri, akiről szól. Amíg nem mondják meg, mit láttak, addig a hézagot olyan történetek töltik ki, amiket senki nem tud sem igazolni, sem cáfolni.

Jövő héten folytatjuk.