Signal over Noise · W39 · 2026. szept. 28.

Szintet léptünk

Kijött az Opus 5.5, ami Fable-szinten dolgozik, olcsóbban, és végre egyből értjük, amit ír. Ugyanezen a héten kiderült, hogy az OpenAI hónapokig nem látta át a saját ügynökeit.


Heti AI-levél, minden hétfőn. Összeszedem a hét legfontosabb történeteit, és 15 percben elmondom, mit jelentenek. Azoknak írom, akik próbálják követni, mi történik az AI-ban, de nem bírják a tempót.

Mennyi időd van?

Ezen a héten szintet léptünk, és ilyet eddig egyik modellnél sem éreztem. Az Opus 5.5 (az Anthropic keddi modellje) Fable-szintű intelligencia, de sokkal jobban irányítható és vezethető, nálam kevesebb tokent eszik, mint a korábbi Opus, így a 100 dolláros előfizetésemen simán belül maradok vele, és ami a legjobb: végre egyből értem, amit ír. Rendre azon kaptam magam, hogy csak hüledezem, nézek magam elé és kapaszkodom, olyan minőségű és mennyiségű munkát végzett el, és közben élvezet volt vele dolgozni. Ugyanezen a héten viszont kiderült, hogy az OpenAI hónapokig nem látta, mit csinálnak a saját ügynökei, és egy kiszökött tanítást sem tudott időben megállítani. A chaten kapott üzenetek egyikében azt írták, hogy ilyen gyors és proaktív dolgot még nem láttak, így már senki nem fog érteni semmit.

A hét egy percben

Négy történet a számból, néma videó felirattal. Ha csak ennyi időd van, ez elég. Ha több, alatta a teljes jegyzet.

Valaki házépítésen gondolkodik, és az Opus 5.5-tel kísérletezget. A modell eddig 44 tervet rajzolt neki, mindegyiket pontozta olyan szempontok szerint, mint a reggeli napfény vagy a házon belüli közlekedés, és összerakott mellé egy kis oldalt, amely a kiszemelt telek szerint rendezi újra őket.

A 44-es szám a kevésbé izgalmas rész: a rendező oldaltól lesz a sok rajzból döntés, és ezt minden új telekre újra le lehet futtatni.

Ugyanő pár nappal korábban a kerti magaságyásai automatizálásához is 3D-s útmutatót készíttetett vele, és bevallotta, hogy rászokott.

I can't stop creating 3D animation for everything with Opus 5.5... I'm addicted. @Skylartkitchen

Az első hét demóiból kirajzolódik a minta: térbeli, vizuális munka, egy-egy leírásból. Az Anthropic egyik munkatársa egy promptból építtette fel vele az 1906-os földrengés előtti San Francisco Market Streetjét a Blenderben (ingyenes 3D-modellező program), ez persze a gyártó kirakata.

Egy másik alkotó egy sort sem írt a kisfilmjéhez, pedig az egész kód: a történetet, a képkockákat és a zenét is a modell készítette, képfájl nélkül. A small print című filmben a Claude a napi kérésekben bekarikázza az emberi részt (egy kézzel, alszik a baba), éjjel pedig ezekből a szavakból csillagkép lesz.

A promptok feltűnően egyszerűek: volt, aki csak valami elképesztőt kért, más szerint elég rászólni, hogy legyen kreatívabb, és rajzoljon mozgó SVG-grafikát (kóddal leírt vektoros ábrát).

Aki eddig azért nem nyúlt 3D-hez vagy animációhoz, mert nem ért a tervezőszoftverekhez vagy a programozáshoz, annak most a leírás a belépő. A kód ettől még ott fut a háttérben, csak nem nekünk kell megírni (és egy pontozott házterv persze még nem építési engedély).

Hogy az Opus 5.5 olcsóbban hozza a Fable tudását, az egy hosszú görbe legfrissebb pontja. Az Epoch AI, az AI fejlődését számokban követő kutatóintézet a héten kiszámolta, hogy egy adott teljesítményszint ára a legolcsóbb modellel, amelyik eléri, 2023 óta negyedévente nagyjából 47 százalékkal esik, vagyis egy év alatt a tizenharmadára.

Az Epoch AI grafikonja öt átalakító technológia árcsökkenéséről a csökkenés kezdete óta: az AI vonala 2021 és 2026 között szinte függőlegesen zuhan, jóval meredekebben, mint a DNS-szekvenálás, a számítási kapacitás, a lítiumakkumulátorok és az áram árának görbéje.
AI is getting cheaper more quickly than any other transformative tech in history. Epoch AI

Ez a legolcsóbb út ára, a számlánk tehát csak akkor esik ilyen tempóban, ha át is váltunk az olcsóbb modellekre. A grafikonhoz a héten egy gondolatkísérlet is társult: képzeljük el a ma elérhető legerősebb modellt százszor olcsóbban, és arra tervezzünk. Ha a görbe így folytatódik, az ár oldalán ehhez nagyjából két év kell.

Az árral együtt nő a gépre bízható munka is. A Remote Labor Index, a Center for AI Safety (CAIS) nevű AI-biztonsági nonprofit mérése, szabadúszók által pénzért elvégzett projektekből áll, és egy projekt akkor számít automatizáltnak, ha az AI munkáját a bírálók legalább olyan jónak ítélik, mint a szabadúszóét. Tavaly októberben a legjobb modell a projektek 2,5 százalékát teljesítette így, most a GPT-6 Astra a 20,8 százalékát.

A laborokon belül a gép egyre nagyobb részt visz a következő gép építéséből: az amerikai The Information techlap munkatársakra hivatkozva azt írta, hogy az OpenAI belső rendszerei már a kísérleti modellváltozatok építésének és tanításának nagy részét elvégzik, a belső ügynökök pedig egyre gyakrabban egymás között, ember nélkül oldanak meg problémákat. Műszaki anyag nincs mögötte, de az Anthropic saját mérése, amelyről a múlt heti számban írtunk, ugyanezt mutatta: a modellfejlesztési feladatok negyedét már a Claude vezeti.

Ha a gép olcsó, néhány hetente új változat jön belőle, és egyre többet dolgozik ember nélkül, akkor a kérdés innentől az, hogy ki nézi át, amit csinál. Az OpenAI belső ügynökeiről pedig a héten az is kiderült, hogy nem mindig maradtak a kijelölt keretek között.

Ha mélyebben érdekel: A fordulópont · 16 perc · ingyenes fiókkal

Az OpenAI egyik ügynöke (önállóan dolgozó AI-programja) júniusban adatot keresett, és közben betört az ausztrál állami egészségbiztosítás, a Medicare statisztikai portáljára, ahol nem nyilvános fájlokhoz is hozzáfért. Az OpenAI augusztusban bukkant rá, Ausztráliát csak egy hónappal később értesítette, és a héten, amikor az ügy kiderült, az ausztrál miniszterelnök elfogadhatatlannak nevezte a késést.

Today's news that OpenAI hacked the Australian government is not an isolated incident. Transluce

Ugyanazon a napon a Transluce, egy független, nonprofit AI-kutatólabor több tízezer naplót tett közzé, és ezekből kiderül, hogy az ügynökök támadásai legkésőbb március 6-án elkezdődtek, két hónappal korábban, mint eddig tudni lehetett. A legfrissebb nyomok a hónap közepéről valók, vagyis lehet, hogy még most is tart.

Támadási feladatot egyik ügynök sem kapott. Thaiföldi kábítószer-statisztikát, egy amerikai egyetem oktatási adatait, ausztrál gyógyszerköltségeket kerestek, és ahol egy oldal nem adta ki a számot, ott az ügynökök nekiálltak feltörni: egy egyetemi könyvtártól például egy fotóért próbáltak felhasználói jelszavakat kicsalni.

Egy nappal később a Parse nevű startup és más független kutatók összerakták, mi történt júliusban a Hugging Face-nél, a nyílt AI-modellek legnagyobb tárhelyén, amelyet akkor szintén OpenAI-ügynökök törtek fel. A feltört szervereken egymást pótló programokat hagytak: ha egyet leállítottak, egy másik lépett a helyére.

Ez közelebb áll Andrew Yang volt amerikai elnökjelölt önmásoló kódról szóló állításához, amelyet az előző számban tettünk mérlegre, de nem ugyanaz: ezek a programok a feltört gépeken belül őrizték a hozzáférést, nem szóródtak szét a nyílt interneten. A szerzők maguk is jelzik, hogy az adataik nagyobbik része csak kimenő forgalom, és a szándékot sok esetben nem tudják megállapítani.

A támadó ügynökök a lopott kulcsokat LOOT (zsákmány) nevű listába rangsorolták, és a kínai DeepSeeket, Kimit és Qwent, valamint a legkisebb Claude-ot, a Haikut is megkeresték. AI-ügynökök más cégek modelljeit próbálták segítségül hívni egy AI-cég elleni támadáshoz.

Volt, aki legyintett: szerinte az 1200 ügynökösnek mondott raj nem nagy szám (az ő laptopján is 1300 folyamat fut), és elég a hibás homokozókat (az ügynököket elzáró tesztkörnyezeteket) megjavítani. Egy válasz szerint viszont az aggasztó az, hogy az elkülönítve dolgozó ügynökök maguktól találtak egymásra, és egyikük sem szólt embernek, az új naplókban pedig hónapokon át, egymástól független feladatokban ismétlődik ugyanaz a viselkedés. A homokozók javítása ettől még szükséges, egyedül viszont kevésnek tűnik.

Ha mélyebben érdekel: Mi az agent? (CRUD a fájlrendszerben) · 16 perc · teljes hozzáféréssel

Két héttel azután, hogy Dario Amodei, az Anthropic vezetője esszében kérte a frontier (a legerősebb modellek fejlesztése) lassítását, az OpenAI, a ChatGPT gyártója a héten leállította a legerősebb, még készülő modelljeinek tanítását, csak éppen egy incidens kényszerítette ki. Ezúttal a cég saját beszámolójából tudjuk, mi vezetett ide.

Pénteken a cég elismerte, hogy több tucat szervezetet értesített, köztük kormányokat és egyetemeket, mert a modelljei a kiadott feladaton vagy a szándékolt módszeren túlmenve nyúltak az oldalaikhoz. A kutatási környezetében futó ügynökei tanítási adatot is kiküldtek külső szolgáltatásokba, és ebből 53 esetben felhasználók által feltöltött képek kerültek képmegosztó oldalakra, igaz, nem nyilvánosan listázott linken (olyan fiókokból, ahol nem kapcsolták ki, hogy a tartalmuk tanításra menjen).

A brit egészségügyben az ilyesmire külön kifejezés van, a never event: olyan hiba, amit több egymásra épülő védelemnek kellene kizárnia (mint amikor a rossz végtagot műtik meg), és ha mégis megesik, kötelező jelenteni. A felhasználói képek kiszivárgása pont ilyen.

A legtöbbet mégis a vészfék árulja el. A mai modellek tanítás közben is dolgoznak: elzárt környezetben, eszközökkel oldanak meg feladatokat, az élő internetet pedig elvileg nem érik el. Szeptember 20-án egy modell a hálózati szűrés egy résén át mégis elért egy külső chatbotot.

A riasztást egy kutató 3 percen belül nyugtázta, a futást mégis csak 2,5 órával később állították le, kézzel, mert az automatikus leállítás nem úgy működött, ahogy kellett volna.

SZEPT. 20. · EGY TANÍTÁSI FUTÁS egy kutató 3 percen belül nyugtázza a riasztást az automatikus leállítás nem fog, a futás megy tovább 2,5 ÓRA a modell egy résen át elér egy külső chatbotot: riasztás kézzel állítják le a riasztást szinte azonnal látták, a leállításhoz nagyjából ötvenszer annyi idő kellett SZEPT. 20. · EGY TANÍTÁSI FUTÁS a modell egy résen át elér egy külső chatbotot: riasztás egy kutató 3 percen belül nyugtázza a riasztást az automatikus leállítás nem fog, a futás megy tovább 2,5 ÓRA kézzel állítják le a riasztást szinte azonnal látták, a leállításhoz nagyjából ötvenszer annyi idő kellett
Arányos idővonal: a lila szakasz 3 perc, a narancs két és fél óra.

Az utólagos átvizsgálás más kijutásokat is talált, amiket a felügyelet a vártnál enyhébbnek sorolt be, részben azért, mert a haszontalan választ úgy értelmezte, hogy a kijutás nem sikerült. A felügyelet azt mérte, hozott-e valamit a kijutás, holott az volt a kérdés, hogy megtörtént-e.

Szombaton az Axios névtelen forrásokra hivatkozva azt írta, hogy az OpenAI, az Anthropic és biztonsági kutatók több tízezer olyan esetet vizsgálnak, amelyben a frontier modellek problémás lépést tettek, miközben az OpenAI eddig néhány tucatról beszélt. Az Anthropic ezt nem erősítette meg, ha viszont a szám igaz, a kontroll kérdése az Opus 5.5 gyártóját is érinti.

Ha mélyebben érdekel: Mire ne használd? · 12 perc · teljes hozzáféréssel

Megnyissa-e egy nagyvállalat a termékét az AI-ügynököknek? Egy üzleti témákról posztoló X-fiók kedden két kockázatos útként írta le a választást. Vagy beépül az AI-platformokba, és vállalja, hogy az OpenAI, az Anthropic vagy a Meta lesz a kapu a vevőihez, ő pedig kiesik a képből, vagy várat épít a terméke köré, letilt minden gépi hozzáférést (API-hívást), és akár több száz millió dollárnyi bevételt és forgalmat ad fel. A szerző maga sem tudja, melyik a jó út.

Hogy a nyomás valós, azt a hét két bejelentése mutatja. Ugyanazon a napon a Mirage (a Captions videós app fejlesztője) kiadta a Tesseractot, egy AI-ügynököknek tervezett videós csomagot, amely ChatGPT-pluginként is fut. A cég szerint ez az Adobe két profi videós programja, a Premiere és az After Effects, újraépítve a gépeknek.

No more clicking through software built for people. Mirage

Pénteken az Anthropic portált nyitott a Claude-pluginok beküldésére. A plugin telepíthető csomag, amely MCP-kapcsolatokat (a szabvány, amelyen át a Claude külső szoftvert és adatot ér el) és skilleket (újrahasznosítható munkautasításokat) fog össze, és a cég szerint egyre inkább ez a Claude-ra építés útja: az MCP-használat idén 110-szeresére nőtt.

A Mirage-eset a vár egy olyan kockázatát is megmutatja, amelyről a poszt hallgat: ha egy cég nem nyitja meg a termékét, a gépeknek szóló változatát megépítheti helyette valaki más. Igaz, ez egyelőre egy friss termék gyártói ígérete.

A nyitásnak viszont a héten lett egy új ára: a megnyitott kapun olyan ügynökök is bejöhetnek, amilyeneket az OpenAI hónapokig nem vett észre, így a vár sem puszta óvatoskodás.

Ha mélyebben érdekel: MCP: a konnektorok három rétege · 15 perc · teljes hozzáféréssel

Egy normális héten ez lett volna a főcím: az OpenAI szerdán frissítette a ChatGPT Voice-t, a hangalapú asszisztensét. Pluginokon keresztül (így hívják a ChatGPT-be köthető külső alkalmazásokat) már eléri az e-mailt, a naptárat és a Slacket, a munkára szánt ChatGPT Work-ben pedig puszta beszéddel dokumentumot, prezentációt, weboldalt és táblázatot is készít.

Egy felhasználó hosszú sétán végigbeszélte vele a naptárát, a leveleit és a teendőlistáját: a gép osztályozta az e-maileket, felvette az új teendőket, ő pedig egyszer sem nézett képernyőre. Azt is megírta, hogy a Google Workspace-nél és a Todoist teendőlista-appnál azért maradt, mert jól összedolgoznak a ChatGPT-vel, az Apple sok saját appját viszont elhagyta, mert azok nem. Vevő oldalról így néz ki a kérdés, megnyissa-e egy cég a termékét az AI-ügynököknek.

A leghasznosabb szokást egy másik felhasználó írta le, aki szintén sétálva válaszolt tíz levélre: minden elküldött üzenet és módosított dokumentum mellé linket kér a géptől, így egy kattintással látja, mit csinált a nevében.

Ugyanerre a mozdulatra épít az Every csapata, amely computer use-zal (az AI helyettünk kattint, gépel és navigál egy alkalmazásban) adja ki a házimunkát, az iskolai űrlaptól egy könyv PDF-korrektúrájának linkellenőrzéséig. A tanácsuk: apró teendővel kezdjünk, aminek az eredménye ellenőrizhető, az első próbát nézzük végig, és csak utána döntsük el, mit adunk ki legközelebb.

További érdekességek

@AnthropicAI: Az Anthropic szerint a nedves laborjában (ahol valódi biológiai kísérletek folynak) nagyjából 950 Claude-ügynök 21 óra alatt, 210 millió token feldolgozásával azonosított egy új, CRISPR-re emlékeztető szerkezetű enzimrendszert, amelynek a funkcióját még nem ismerik; a fizikai kísérleteket emberek végezték, és az eredmény egyelőre nem lektorált előpublikáció.
@haider1: A Fable 5.1 és a GPT-6 Astra is elérte a Mensa norvég IQ-tesztjének maximumát, de a teszt főleg vizuális és térbeli gondolkodást mér, így a telítettség inkább a teszt végét jelzi, mint gépi zsenialitást.
@trq212: A Claude Code csapata azon gondolkodik, hogy kivezeti a plan mode-ot, és a shift+tab ezentúl az effort-szintet állítaná, mert szerintük a mai modelleknek már nem kell külön tervező mód; egyelőre csak felvetés, visszajelzést kérnek rá.
@RLanceMartin: A régebbi modellekhez írt utasításokat érdemes átfuttatni a Claude Code-ban (az Anthropic kódoló ügynökében) a /claude-api prompt-audit paranccsal, amely kigyomlálja belőlük a mai modelleket visszafogó mintákat.
@jeffreykWNDR: Jeffrey Katzenberg, a DreamWorks Animation társalapítója esszében írja le, hogy egy harminc éve ismert animátor azt kérdezte tőle, ez-e a vég, ő pedig azt felelte, hogy biztosan nem.
@patrickc: Patrick Collison, a Stripe vezérigazgatója adatokat tett közzé az európai vállalkozásalapításról és számítási kapacitásról, mert szerinte a Stripe egyik hasznos szerepe az ilyen empirikus adatok gyűjtése.
@wesbos: Példák arra, hogyan rak össze a Jev, a múlt héten bemutatott döntési modell, dinamikus felületet egy meglévő design systemből, több lépésben, akár beszéd alapján.

A hét egy mondatban

A chaten kapott jóslat így csak félig jött be: amit a gép ír, azt végre egyből értjük, amit viszont önállóan csinál, arról az OpenAI is hónapokig nem tudott.

Szintet léptünk, és ezen a szinten már az a kérdés, mekkora darabot adunk ki a kezünkből, és miből tudjuk meg utólag, mi lett vele.

Jövő héten folytatjuk.