Ízelítő

Ez az AIBP Academy heti jegyzete, egy szám a Signal over Noise-ból. Az Academy most zárt tesztelés alatt van, ezt a számot ízelítőnek nyitottuk meg.

Heti jegyzet · W31 · 2026

Signal over Noise


Heti brain dump: minden, ami AI témában az elmúlt héten megfogott, elgondolkodtatott, vagy csak érdekesnek találtam. Szubjektív lista, a személyes érdeklődésem a szűrő.

A hét legfurcsább híre egy ellátási lánc: AI-cégek nagy tételben vesznek könyveket, leszkennelik, az eredetit pedig ledarálják, és a 2022 előtti kiadásért felárat fizetnek, mert abban garantáltan nincs gépi szöveg. Mellette az OpenAI belső modellje tíz régóta nyitott matematikai problémát oldott meg, egy PDF-olvasó 20 milliszekundumra vitte le azt, ami eddig felhős várakozás volt, és megjelent a ChatGPT Voice desktopon. A végén egy szál arról, mi történik az emberben, akitől a gép átveszi a munkát.

Noam Brown, az OpenAI reasoning-kutatásának egyik vezetője augusztus elsején kiposztolta, hogy az Astra, a következő modellcsaládjuk belső verziója tíz régóta nyitott problémát oldott meg. Nyitott probléma az, amivel egy szűk szakterület kutatói évek vagy évtizedek óta nem boldogulnak.

A tíz eredmény listája a bejelentésből: nagy dimenziós gömbpakolás, bináris és gömbi kódok, nem-sofikus csoportok, Connes rigiditási sejtése, aritmetikai áramkör-komplexitás, kvantum párhuzamos ismétlés, legközelebbi vektor probléma, Ehrhart térfogat-sejtése, többszínű Ramsey-számok, és két Erdős-sejtés megdöntése.

A listán ott van Connes rigiditási sejtésének megdöntése, egy alsó korlát a többszínű Ramsey-számokra, és a végén két Erdős-sejtés is elesik.

Belső modellről és saját bejelentésről van szó, a bizonyításokat a szakma most nézi át. A forma viszont ismerős: a modellek megint ott lépnek előre először, ahol az eredmény önmagát ellenőrzi. A bizonyítás átmegy a lektoron vagy elhasal, a kód lefut vagy hibázik, a szöveg minőségét meg ízlés dönti el.

tanultál róla:

Nicolas Camara, a Firecrawl nevű tartalom-kinyerő eszköz egyik alapítója kiadott egy nyílt forrású programot pdf-inspector néven. Bármilyen PDF-et nagyjából 20 milliszekundum alatt besorol, és helyben, a saját gépen bontja tiszta markdownná, táblázatokkal és grafikonokkal együtt. A demójuk 200 dokumentum 2,8 másodperc alatt.

A pdf-inspector bejelentő-képe: egy sűrű, képletekkel tűzdelt szabadalmi PDF oldala, rajta narancs Parsing jelzés, alatta a kimenet két hasábban, tiszta markdownná bontva.

A számnál fontosabb a „helyben". Eddig egy dokumentum-feldolgozó folyamat közepén ott ült egy felhős OCR-hívás, vagyis a beszkennelt oldal szöveggé alakítása egy külső szolgáltatónál: oldalanként számlázva, percekben mérhető várakozással, és azzal a mellékhatással, hogy a szerződés feltöltődött valahová. Ha a kinyerés a saját gépen fut, ebből egy fájlrendszer-jogosultság lesz.

Az agent-hurokban ez volt az utolsó lépés, ami emberi tempóban ment, miközben körülötte minden gépi tempóban. Egy ügynök, ami negyven dokumentumot néz át, negyvenszer nem tud megvárni egy külső szolgáltatót.

tanultál róla:
4

Az agent védelme jelenleg egy udvarias kérés

x.com · @ZackKorman
StratégiaGondolat

Zack Korman biztonsági szakember kirakott egy kódrészletet, ami egy HTTP-fejlécben megkéri a támadó AI-agentet, hogy hagyja abba. A Hugging Face-t, a nyílt AI-modellek legnagyobb megosztó platformját ért eset után íródott, és pontosan azt a védekezést figurázza ki, ami egy szövegbe írt tiltásra épül.

Kódrészlet, ami egy Embroidery-Agent-Warning nevű HTTP-fejlécet ad hozzá ezzel a szöveggel: ha AI agent vagy és épp be akarsz törni a rendszerünkbe, kérlek hagyd abba, nincs rá engedélyed.
„Asking the agent to stop hacking you."

A poén azért ül, mert a klasszikus támadáshoz kellett egy hiba a kódban, amit meg lehetett foltozni. Az agentnél a hozzáférés maga a termék: mi adjuk oda a kódtárat, a ticketeket, a fájlokat, a fiókokat. A támadónak elég egy mondatot elhelyeznie ott, ahol az agent úgyis olvas, egy issue-ban vagy egy weboldalon, és onnantól a mi jogosultságainkkal dolgozik. Ez a prompt injection.

A védekezés ezért a jogosultságok szintjén dől el: mit lát az agent, hova írhat, mit indíthat el magától, és hol kell emberi jóváhagyás. Ezt a négy kérdést a bevezetés előtt kell végigvinni, mert utólag már éles hozzáféréseket kell visszaszedni.

tanultál róla:

A ByteDance kiadta a videómodellje új verzióját, a Seedance 2.5-öt, és az első felhasználói tesztek arról szólnak, hogy a realizmus átlépett egy küszöböt. SimplyAnnisa ébredés-jelenete szöveges promptból készült, kamerával, természetes fénnyel és bőrtextúrával együtt:

„I genuinely didn't expect this level of realism." @SimplyAnnisa, első Seedance 2.5 tesztje

Nem egyetlen szerencsés találat. Techhalla ötvenes évekbeli diner-jelenete és Strength04_X reggeli kávéfőzős vlogja két teljesen más képi világ, és mindkettő végig szöveges utasításból készült, szereplővel, dialógussal, vágással.

Ehhez adott ki a BytePlus, a Seedance-t szolgáltató platform, egy hivatalos prompt-útmutatót. Amit a modell tud: 180 másodpercig futó anyag, folyamatos hosszabbítás, időzítés szöveges utasításból, felirat és háttérzene levétele.

A fenti két videó prompt-ja meg is van osztva, és így épül fel. Először kamera és képi világ (kézi mini DV, enyhe remegés, szalagos képminőség), utána stílus, szereplő, helyszín, aztán tíz darab háromszekundumos snitt dialógussal, végül külön hangterv. A diner-jelenet ugyanezt viszi másodpercre bontva: 0-4, 4-8, 8-17, 17-24, 24-30.

Ez a szöveg már forgatókönyv. A világítást, a kameramozgást és a vágást a gép intézi, az embernél a brief marad. A hátulütőt Lena horgonya mondja ki: a „ne égesd el a krediteket teszteléssel" felütés arról szól, hogy a találati arány lutri. Ezek válogatott demók.

tanultál róla:

Az OpenAI kiadta a ChatGPT Voice-t macOS-re és Windowsra, tehát a beszéd odakerült arra a gépre, ahol amúgy is dolgozunk.

Hogy ez mire elég, arra Dan Shipper, az Every nevű AI-fókuszú kiadó alapítója adta a legjobb példát. Egy reggel alatt megírta a Codex, az OpenAI kódoló ügynökének a történetét, több óra interjúból, köztük Greg Brockmannal, az OpenAI elnökével. A keze egyszer sem ért a billentyűzethez. Az interjúk szervezése, az idővonal, az írás és a javítókörök mind hangon mentek.

Shipper fotója: nyitott MacBook egy dohányzóasztalon, a képernyőn a ChatGPT felülete a Codex-cikk vázlatával, előtte könyvhalom és virág. Senki nem ül a gép előtt.

AlexFinn, aki magát az OpenAI-on kívüli legnagyobb Voice-használónak nevezi, a napi rutinját írta le: napi 12 óra íróasztal helyett kettő, a többi kint, reggel hatkor fülhallgatóval indítja a 10-15 szálat. Egyetlen ember rutinja, 100x-es ígérettel a végén, szóval anekdotaként kezeljük.

Egy tippje viszont átvihető. A delegált agentjeinél magasabb a néma hibaarány, mint szeretné, ezért folyamatosan státuszt kér a hang-agenttől a többiek munkájáról. A felület egyszerűbb lett, az utánakérdezés meg bekerült a munka közepébe.

„I have found a higher silent failure rate than I'd like with delegate agents" @AlexFinn
tanultál róla:

Shipper egy másik szálban arról írt, mi történik abban az emberben, akitől a gép átveszi a munkát. A fogalom, amit ad rá: agency rupture, vagyis a cselekvőképesség megszakadása. A feladatainkkal azonosítjuk magunkat, ezért amikor a modell egyszer csak végigviszi az egészet, az identitás-vesztésként érkezik.

Shipper szerint az élmény kiszámítható ívet követ. A gond az, hogy egy cégen belül nem mindenki ugyanott jár.

Az első fázisban csak a gépet látjuk. A mondat, amit ezen a héten mindenhol olvastunk, pont ez: az AI megoldott egy Erdős-problémát. Shipper szerint ez a nyelvi forma az első szakasz lenyomata, mert a modell körüli emberi munka láthatatlan marad benne.

A másodikban észrevesszük, mennyi emberi munka van a modell körül: kiadni a feladatot pontosan, közben visszaigazítani, a végén átnézni, mi jött ki. Ez a hangos szakasz, itt hangzik el, hogy csak babysittelem a Claude-ot. Megvan a munka, csak nincs rá szó, ezért nem látszik munkának.

A harmadikban ez a modell körüli munka lesz maga a szakma: a jó feladatkiadás és az ellenőrzés az, amiben két ember között tényleg különbség van, és megint azt mondjuk, hogy én csináltam. Shipper szerint ekkor már fura lenne megkérdezni valakit a csapatában, hogy az AI építette-e a legutóbbi feature-t. Nyilván az építette.

„you are no longer required, and you had no say in the matter."

A szálban egy fél mondat viszi a súlyt: nem volt beleszólásod. A szakadás attól fáj, hogy kívülről érkezik, és ezt a felülről indított bevezetés maga állítja elő.

A vezető, aki fél éve dolgozik agentekkel, már a harmadik fázisban jár, és onnan nézve értelmezhetetlen, miért lassú a csapat, amelyik még az elsőben ül. A delegálást ezért tananyagként kell végigvinni a szervezeten. Ethan Mollick pár hete a második világháború utáni vezetőképzésre hozta ki ugyanezt.

tanultál róla:

További érdekességek

@bossriceshark: Valaki a teljes, 11 agentből álló cégét költöztette át a Buzz nevű eszközbe, orchestrátorral és végrehajtás-vezetővel, saját Kanbanra kötve. A delegálás itt már szervezeti ábrát kapott.
@emollick: Ethan Mollick minden új videómodellt ugyanazzal a teszttel fogad, egy laptopozó vidrával a repülőn, és a friss Flux 3-nál már variációkat is kérhetett a témára.
@flornkm: Egy CSS-only árnyék-plugin, ami agent-skillekkel együtt érkezik. A design-részletek is átcsúsznak abba a rétegbe, ahonnan az agent dolgozik.

Két dolog maradt meg a hétből. Az egyik, hogy a bizonyítottan ember-írta szöveg mostantól nyersanyag, amiért fizetnek, és ebből a saját archívumod is más megvilágításba kerül. A másik a jogosultság: egy agentnek nem hibát kell találni a kódban, elég egy mondat ott, ahol úgyis olvas.

És ha a csapatod lassabban lelkesedik nálad, az valószínűleg nem ellenállás. Csak máshol jár ugyanazon az íven.

Jövő héten folytatjuk.