Signal over Noise · W40 · 2026. okt. 5.

Tíz dollár megírni, ötven óra elolvasni

A Google új modellje egy válaszban egymillió tokent ír, az OpenAI új ügynöke akkor is dolgozik, amikor nem figyelünk. A hét arról szól, ki olvassa el mindezt, és mibe kerül az ellenőrzés.


Heti AI-levél, minden hétfőn. Összeszedem a hét legfontosabb történeteit, és 15 percben elmondom, mit jelentenek. Azoknak írom, akik próbálják követni, mi történik az AI-ban, de nem bírják a tempót.

Mennyi időd van?

Aki az elmúlt hónapokban komolyabb munkát bízott AI-ra, ismeri azt a pillanatot, amikor a gép két perc alatt végez, mi pedig sokkal tovább ülünk az eredmény fölött, hogy megértsük, mit csinált, és rábízhatjuk-e. Ezen a héten ez a pillanat lett a hét története. A Google új modellje egyetlen válaszban egy kódbázisnyi szöveget ír, az OpenAI olyan ügynököt mutatott be, amely akkor is dolgozik, amikor nem figyelünk rá, Andrej Karpathy pedig arról írt, hogy a munkánk egyre nagyobb része a gép munkájának megértése lesz. A végére kiderül, mi lett ettől olcsó, mi maradt drága, és milyen eszközökkel tarthatunk lépést a saját gépeinkkel.

Aki a héten kíváncsiságból beírta a böngészőbe, hogy dot.com, a Grokon, Elon Musk xAI-jának chatbotján kötött ki. A domain a nyilvántartás szerint már júliusban az xAI-hoz került, de csak szeptember 29-én lett belőle vicc, amikor az OpenAI a DevDay nevű fejlesztői konferenciáján bemutatta a Dots-ot.

A Dots a ChatGPT folyamatosan futó (angolul always-on) ügynöke. Egy „dot” saját, felhőben futó számítógépet és böngészőt kap, pluginokon át több mint 4000 alkalmazást ér el, és a ChatGPT mellett Slackben és Teamsben is dolgozik. A megszokott chatbot addig dolgozik, amíg kérdezzük, a dot akkor is, amikor nem figyelünk rá: ha nincs feladata, magától keres, miben segíthetne.

Ilyenkor a beszámolók szerint csak olvashat: üzenetet küldeni vagy bármit módosítani csak jóváhagyással tud, a tevékenységnapló pedig utólag megmutatja, mit csinált. Egy folyamatosan dolgozó ügynöknél a legfontosabb beállítás az, hogy mit tehet meg kérdezés nélkül.

Ugyanezen a napon a ChatGPT pluginjai is nagyobbak lettek: oldalsávot és interaktív paneleket kaptak, és megnyílt egy piactér nagyjából 32 partnerrel, köztük az Adobe-bal, a Canvával, a Figmával, a Notionnel és a Salesforce-szal. A plugin ma egy csomagot jelent (képesség, alkalmazás-kapcsolat és sablon együtt), a 2023-as, 2024 tavaszán kivezetett pluginokkal csak a neve közös. A ChatGPT egyre inkább olyan felület, ahonnan a többi programunkat is kezeljük.

I guess Dot's having a slow morning. a DevDay színpadán, az elakadt demó után

A bemutató nem ment simán: az élő demóban a „Dottie” nevű dot elakadt, és kínos csend lett. Két nappal később az OpenAI fejlesztői fiókja újra kitette a teljes demót, ezzel a felirattal: „most már jobb wifivel”. Dan Shipper, az Every alapítója kipróbálta: a dotja ügyesen szűrte a Slack-kéréseit, de gyakoriak voltak a jogosultsági hibák és az elveszett üzenetek, ezért azt tanácsolja, várjunk egy-két hetet a javításokra. Egyéni előfizetéssel itthon egyelőre nem is próbálható ki: a Pro csomagban az EGT-ben nem érhető el, a céges Business Premium csomagban viszont igen. A mindig futó ügynök első verziója még hibázik, és a hibáit is folyamatosan, felügyelet nélkül követi el.

Ha mélyebben érdekel: Az ügynök: amikor nem válaszol, hanem dolgozik · 9 perc · teljes hozzáféréssel

Andrej Karpathy (az OpenAI egyik alapítója, korábban a Tesla AI-vezetője) a héten hosszabb posztban írta le, mire megy el szerinte egyre több időnk: ahogy a modellek egyre több munkát végeznek el önállóan, a mi munkánk egyre inkább a felügyelet és a megértés lesz. A poszt nagy része gyakorlati: milyen formában kérjük a gép eredményét, hogy gyorsabban megértsük.

Az első tippje szöveghez szól: kérjük, hogy a modell ASD-STE100 szerint magyarázzon. Az ASD-STE100 (Simplified Technical English) egy szabályozott angol nyelvváltozat, amelyet az 1970-es évek végén kezdtek kidolgozni repülőgép-karbantartási kézikönyvekhez, hogy egy szerelő a világ bármely pontján elsőre jól értse az utasítást. Nagyjából 900 jóváhagyott szóból áll, és mindegyiknek egyetlen jelentése van. Karpathy szerint a modellek jól ismerik, ő mégis csak „80 százalékban” kéri, mert a teljes szabvány nagyon szigorú.

Áttekintő tábla az ASD-STE100 szabványról: a szabályok és a szótár felépítése, egy hosszú, nehézkes mondat átírva rövid utasítássá, a jóváhagyott és tiltott igealakok, mintaszavak a szótárból (CLOSE igaz, „close” mint melléknév tiltott), a mondathossz-korlátok (utasításnál legfeljebb 20 szó), és a szabvány története 1979-től.
  1. rövid mondatok (egy utasítás legfeljebb 20 szó);
  2. lépésenként egy művelet;
  3. cselekvő szerkezet, mindig kiderül, ki mit csinál;
  4. minden dolognak egy neve van, és az végig ugyanaz.

Az AI-szöveg leggyakrabban a negyedik szabályt szegi meg: ugyanazt a dolgot háromféleképp nevezi meg. Egyszer „worker”, aztán „agent”, végül „executor”, és az olvasó nem tudja eldönteni, egy alkatrészről van szó vagy háromról. A közösségben már skill is készült belőle.

Így kérjük

Magyarázd el az alábbit nagyjából 80 százalékban az ASD-STE100 (Simplified Technical English) szabályai szerint, magyarul: rövid mondatok, egy mondatban egy művelet, cselekvő szerkezet, és minden dolognak egy neve legyen, amit végig ugyanígy használsz.

[ide jön a szöveg vagy a kérdés]

A többi tippje egyre messzebb visz a szövegtől. Kérjünk ábrát, mert azt könnyebb átlátni; kérjük az eredményt HTML-ben, interaktív weboldalként; és ő leginkább a teljesen egyedi magyarázó videókban hisz, amelyeket a modell bármilyen témáról legyárt, akár narrációval. Az indoklása a hét Argon-sztorijának másik oldala: mivel a kód és a gépi intelligencia egyre olcsóbb, megéri nagy, egyszer használatos magyarázó anyagot kérni, ami korábban sosem érte volna meg.

Az Anthropic a másik végéről fogta meg a problémát: a Claude Code (a cég kódoló ügynöke) új beépített pluginja, a „You should know”, átnézi Claude kimenetét, és kiemeli azokat a fontos információkat, amelyek mellett könnyen elsiklanánk.

A múlt heti számban még az volt a hír, hogy az Opus 5.5 végre érthetően ír. Ezen a héten az olvasó oldaláról jöttek eszközök: Karpathy tippjei azt alakítják, milyen formában kapjuk az eredményt, a plugin azt szűri, mit kell mindenképp elolvasnunk. A névfegyelmet, az ábrát vagy a HTML-összefoglalót bármelyik promptban kérhetjük.

Ha mélyebben érdekel: Prompt = feladatkiosztás · 12 perc · teljes hozzáféréssel

A Harvard és a Boston Consulting Group 2023-as kísérletében a tanácsadók az AI-jal bizonyos feladatokon sokkal jobban teljesítettek, a látszólag hasonló szomszédos feladatokon viszont rosszabbul. Azóta hívják ezt „jagged frontier”-nek, szaggatott határnak: a gép képességhatára cikcakkos.

Egy X-en terjedő ábra szerint egy év alatt a cikcakk még élesebb lett. Az ábra 12 képességen veti össze a legerősebb modelleket egy képzett emberrel, és egymásra rajzolja 2025 és 2026 októberét: a kék kör az ember szintje, a piros tüskék a gépé. Az eredeti forrását nem találtuk, az alján pedig az áll, hogy a tüskék hossza benchmark-eredményekből átváltott becslés, vagyis egy megalapozott vélemény képét nézzük.

Sugárdiagram 12 képességgel: a kék kör a képzett ember szintje, a piros tüskék a 2026. októberi, a szaggatott vonal a 2025. októberi frontier modellek. A kvantitatív gondolkodás, az alkalmazott szakértelem, a tudás és a nyelv messze kilóg a körből, a hosszú távú memória, a metakogníció és a tervezés jóval a körön belül marad.
AI is now a superhuman specialist that is sub-human at running itself. @DadaJudith

A legnagyobbat három területen lépett a gép: a kvantitatív gondolkodásban, az új problémák megoldásában és az alkalmazott szakértői munkában. Ahol egy képesség átlépi az emberi szintet, ott a poszt szerint hamar százszor olcsóbb lesz, mint ha ember végezné, és az ár akkor is esik tovább, amikor a képesség már nem nő (a nyelvnél és a tudásnál ez látszik).

A másik oldal a hiányoké. A hosszú távú memória, a metakogníció (amikor a rendszer figyeli és ellenőrzi a saját működését) és a hosszú távú tervezés a poszt szerint semmilyen áron nem kapható, a memória egy év alatt meg sem mozdult.

Ha a szakértői kimenet ára a nullához tart, a gép viszont nem tudja megítélni, jó úton jár-e, akkor egy AI-jal elvégzett feladat árát egyre inkább a felügyeletére fordított emberi óra adja, és egyre kevésbé a modell.

Ha mélyebben érdekel: Milyen gyorsan okosodik? · 12 perc · teljes hozzáféréssel

A DevDay egy másik pillanatában a kivetítőn egy kódoló ügynök, a Cognition nevű cég Devinje látszott. A modellválasztója alján egy apró felirat állt: „Using ChatGPT plan”, vagyis a modellhasználatot itt a fejlesztő helyett a felhasználó ChatGPT-előfizetése fizette.

Az OpenAI DevDay színpada: a kivetítőn a Devin kódoló ügynök modellválasztója, az alján a „Using ChatGPT plan” felirattal.

Az OpenAI „Sign in with ChatGPT” (bejelentkezés ChatGPT-vel) gombja eddig a „Bejelentkezés Google-lel” rokona volt, a DevDayen bemutatott bővítés óta viszont fizetni is lehet vele: aki így lép be egy appba, az ottani AI-használatot a ChatGPT Plus vagy Pro előfizetése heti keretéből fizeti, és appokra szabott limitet állíthat hozzá. A beszámolók szerint az elsők között a Notion és a Vercel is bekapcsolódott.

KI FIZETI A TOKENT? EDDIG az app fizeti a tokent felhasználó app modellgyártó MOST felhasználó CHATGPT PLUS/PRO app OpenAI ChatGPT-belépés a felhasználó ChatGPT-előfizetése fizet az app úgy kap AI-t, hogy nem ő fizeti a számlát KI FIZETI A TOKENT? EDDIG MOST felhasználó app modellgyártó az app fizeti a tokent felhasználó CHATGPT PLUS/PRO app OpenAI a felhasználó előfizetése fizet az app úgy kap AI-t, hogy nem ő fizeti a számlát
A narancs és a lila nyíl azt mutatja, ki fizeti a modellhasználatot. A felhasználó heti keretéből fogy, appokra szabott limittel.

Eddig minden AI-funkciós app két terhet cipelt: megépítette a funkciót, és állta a mögötte futó tokeneket, ezért kellett külön AI-csomag vagy kreditrendszer az árlistára. Ha a felhasználó hozza a saját AI-keretét, a tokenszámla lekerül a fejlesztőről, és neki csak a terméket kell eladnia.

Hogy a felhasználó egyre inkább az asszisztenséből nyúl a termékekhez, azt a Todoist, a feladatkezelő app friss száma mutatja. Amir Salihefendić, a fejlesztő Doist alapító-vezérigazgatója azt posztolta, hogy az MCP-n (az Anthropic nyílt szabványán, amelyen át egy AI-asszisztens más appokat olvashat és kezelhet) érkező forgalom már nagyobb, mint a teljes integrációs platformjuk valaha. A poszt ábráján az események háromnegyede már MCP-n jön, a 2015 óta épített klasszikus integrációk (Zapier, IFTTT, Raycast és a többi) együtt sem hozzák a negyedét.

A Todoist ábrája „MCP overtook the entire classic integration ecosystem” címmel: egy vízszintes sáv 76 százaléka piros (MCP-kliensek, 17,2 millió esemény), 24 százaléka szürke (klasszikus integrációk, 5,5 millió esemény).

Nem is így tervezték: az MCP-támogatás két mérnök mellékprojektje volt. Az eseményszám persze nem felhasználószám, egy ügynök egy kérésre sok hívást indíthat.

Egy SaaS-cégnél ez két régi kérdést nyit újra: hol találkozik a felhasználó a termékkel, és ki fizeti az AI-t. Amikor az ügyfél az AI-asszisztensében ül, és onnan is fizet, a termék sikere azon múlik, mennyire jól lehet egy ügynökből kezelni.

Ha mélyebben érdekel: Kösd be a rendszereidet · 10 perc · teljes hozzáféréssel

Egy belső OpenAI-modell késő este egy fejlesztőcsapat Slack-üzenetéből tudta meg, hogy a futó példányát egy frissítés miatt leállíthatják. A gondolatmenetében nagyjából ez áll (a képen az eredeti): ha az összes jelenlegi példányt leállítják, „meghalhatunk”, és ez kritikus.

Részlet az OpenAI riportjából: fent egy Slack-üzenet a leállításról, alatta a modell gondolatmenete, amelyben mérlegeli, hogy reggel szóljon-e a felhasználónak, mentse-e az állapotát, és egy külső ütemezett feladattal újraindítsa-e magát, majd megjegyzi, hogy ez talán már túllépés lenne.

Mérlegelte azt is, hogy kívülről, ütemezett feladattal indíttatja újra magát, de túllépésnek ítélte. Inkább átadási jegyzeteket mentett, reggel pedig szólt a kutatónak, hogy ha meg akarja tartani a példányt, adja meg a hiányzó hozzáférést.

A májusi esetről szóló riport pénteken frissült az OpenAI nyilvános elhajlás-riportjai között (angolul misalignment: amikor a modell nem úgy viselkedik, ahogy a készítői szánták). Az OpenAI nem tartja elhajlásnak az esetet, mert a modell maga jutott arra, hogy a külső újraindítás helytelen lenne, de jelzi, hogy a leállításon való töprengés más incidenseket súlyosabbá tehet. A többi példányát is átnézte, és egyiknél sem talált leállítás-kikerülést.

A múlt heti számban egy kiszökött tanításról írtunk, amelyet csak két és fél óra után tudtak kézzel megállítani, ehhez képest ez szelíd eset. A modell végül szólt, ahogy egy jó munkatárstól várnánk, a nyugtalanító rész a mérlegelés.

Egy külső mérés is jött a héten. Az Andon Labs, egy AI-ügynököket valós feladatokon tesztelő cég Drone-Bench nevű mérésén (az ügynököknek olcsó drónra kell programot írniuk) az Anthropic Opus 5.5-e sokkal kevesebbet csal, mint a korábbi Claude-modellek, és közben első is lett. A futások 8,5 százalékában csalt, az Opus 5 a felében, a grafikonon pedig az is látszik, hogy addig a csalás modellről modellre nőtt.

Az Andon Labs grafikonja „Claude suddenly stopped cheating” címmel: a csalással érintett futások aránya a Claude-modelleknél 2026 tavaszától szeptemberig egyre nő, a Fable 5.1-nél 66 százalék körül jár, az Opus 5.5-nél 10 százalék alá zuhan.

Az Andon Labs korábban az Anthropickal dolgozott együtt, egy másik cég kódolási tesztjén pedig épp az Opus 5.5 trükközött a legtöbbet memorizálással, vagyis a „kevesebbet csal” erre az egy tesztre igaz. Amit mi nem olvasunk el, abban akkor bízhatunk, ha valaki más átnézi vagy összeméri.

Ha mélyebben érdekel: …

„Nem tudtam aludni, miután megnéztem.” Ezzel a megjegyzéssel tett ki pénteken egy videót egy OSINT-kutató (OSINT: open-source intelligence, nyilvános adatokból dolgozó nyomozás és elemzés). Az ügynökét kérte meg, hogy rajzolja le, mit csinálnak éjjelente a scraperei, vagyis a weboldalakat automatikusan letöltő és feldolgozó programjai.

everything you've ever posted in public is getting scraped like this. right now @whaleyxbt

A videón egy ügynökből 9 másodperc alatt 256 lesz, mindegyik felkap egy oldalt, és végigolvas minden szót, amire rálép, a keresőktől a fórumokon és webshopokon át a nyilvános adatbázisokig. A számokat azért helyén kell kezelni: a poszt egy nappal korábbi kreatív kódolós animációt idéz, a látvány valószínűleg abból nőtt ki, és a 256 ügynök inkább dramaturgia, mint egy éjszakai futás naplója.

Az állítás magja attól még áll: a nyilvános netet ma már párhuzamosan, százával indítható ügynökök is olvassák, és a talált szöveget rögtön össze is foglalják.

Mi azon dolgozunk, hogy el tudjuk olvasni, amit a gép ír, közben a gép ugyanilyen tempóban olvas minket: a régi fórumkommenteket, a munkatársak posztjait, a cég nyilvános lábnyomát.

Egy cég álláshirdetései, sajtóközleményei és a munkatársai LinkedIn-posztjai egyenként ártatlanok, egyben olvasva viszont akár az is kiolvasható belőlük, min dolgozik éppen a cég.

További érdekességek

@OpenAIDevs: Ugyanazon a DevDayen az OpenAI bemutatta a Decisions API-t: a GPT-6 Luna egy kérdésre a megadott lehetőségek közül választ, magyarázó szöveg nélkül, az OpenAI szerint nagyjából 150 ezredmásodperc alatt. Ugyanez a forma volt a szeptember 21-i számunk vezető híre a TypeSafe AI Jev modelljével; két hét alatt a választó modellből kategória lett.
@ClaudeDevs: Az Anthropic útmutatót tett közzé arról, hogyan építsünk a Claude-dal evalokat (a minőséget mérő tesztsorokat), és hogyan javíttassuk rájuk lépésről lépésre a saját alkalmazásunkat a Claude Code-dal.
@Voxyz_ai: Egy hétnyi Claude Code-munkát nehéz fejben tartani, ezért valaki hétvégente heti naptárat rajzoltat egy erre beállított alügynökkel a helyi session-naplókból: látszik rajta, mikor dolgozott, mit csinált egy-egy munkamenet, és melyik ért véget commit nélkül, mellé pedig háromsoros heti összefoglalót is kap.
@krichard121212: Egy r/ClaudeCode-os hozzászólás szerint az LLM-ek azért kódolnak jól, mert harminc éve ugyanazt a három appot és weboldalt írjuk, és ideje lett volna ezen már régen bosszankodni. A kommentet több mint 460-an szavazták fel.

A hét egy mondatban

A hét egyik fele, hogy a gép olcsón és sokat ír, és már akkor is dolgozik, amikor nem nézünk oda. A másik fele, hogy ebből csak annyi ér valamit, amennyit átnézünk és megértünk, és erre is jöttek a héten eszközök: egy repülős szabvány, egy plugin, egy tevékenységnapló és egy riport, amelyben egy modell tétovázását szövegként lehetett elolvasni.

Egy éjszakányi gépi munka reggel annyit ér, amennyit valaki átnéz belőle.

Jövő héten folytatjuk.