Signal over Noise · W28 · 2026. júl. 12.

Az agent dolgozik tovább, te vezetsz

A Claude viszi tovább a munkát, amikor leteszed a laptopot, a GPT-5.6 egy hétig épített egyedül. A Wharton szerint prompt-trükk helyett cél, mérce és ellenőrzés kell.


Heti AI-levél, minden hétfőn. Összeszedem a hét legfontosabb történeteit, és 15 percben elmondom, mit jelentenek. Azoknak írom, akik próbálják követni, mi történik az AI-ban, de nem bírják a tempót.

Mennyi időd van?

A héten az agent folytonos lett. A Claude mobilon és weben is viszi tovább a feladatot, miután letetted a laptopot, a GPT-5.6 pedig napokig épített egyedül egy komplett várost. Az Anthropic közben belenézett, mi jár a modell fejében munka közben, és kiderült: van, amire csak gondol, de nem mondja ki. A vezetői oldalon a friss Wharton-kutatás kimondta, amit régóta sejtettünk: a prompt-trükkök alig érnek valamit, ami számít, az a világos cél, a mérce és az ellenőrzés, vagyis a vezetés. A Starbucks eközben felmondta a dobozos szoftvereit, és a tőzsde megmozdult rá. Ha a gép már magától dolgozik, a kérdés az, hogy te mit vezetsz.

2

A GPT-5.6 közel egy hétig dolgozott egyedül ugyanazon a feladaton

x.com · @mattshumer_ +2
frontier-modellekautonómiaverseny

A másik oldalon az OpenAI hete is erős volt. Matt Shumer megmutatta, mit tud a GPT-5.6, ha időt kap: egyetlen feladatból kiindulva közel egy héten át futott magától, és felépítette Manhattant voxelekből, épületről épületre, hibajavítással, megállás nélkül. A múlt héten a Fable gondolkodási szintjeit mértük egy 3D-s Manhattanen; most a másik labor modellje ugyanazt a várost választotta. A mérce közben megváltozott: már az számít, mennyi ideig tud egy modell értelmesen, felügyelet nélkül dolgozni, a benchmark-pontszám másodlagos.

A gyakorlati oldalt Dan Shipper (az Every alapítója, egy hónapja teszteli) mondja el a legőszintébben: egy hétre elvesztették a hozzáférést, és a Fable mellett is úgy érezte, kőkorszakba került nélküle. Az Every-nél a modell söpri át a bejövő emailt, dönti el, mi érdemel figyelmet, és készíti elő a válaszokat: a napi munka hordozó rétege lett.

És jön a következő lépcső: az OpenAI munkatársa szerint a Sol változat a gép- és böngészőhasználatban világelső, és most kerül be a Codexbe. A két élcsapat fej fej mellett halad, és ez neked jó hír: a folytonosan, napokig dolgozó agent nem egyetlen gyártó kiváltsága, ez lesz az alapfelszerelés.

Ha mélyebben érdekel: A modellek családja · 12 perc · teljes hozzáféréssel
3

Az Anthropic megtalálta, mire gondol a Claude, amikor nem mondja ki

x.com · @AnthropicAI +2
kutatásfekete dobozbizalom

Ha egy modell napokig dolgozik egyedül, egyre fontosabb kérdés, mi jár közben a fejében. Az Anthropic friss kutatása erre ad egy meglepő választ. Az idegtudomány régi elmélete szerint az agyban zajló rengeteg folyamatból az válik tudatossá, ami egy kiemelt „munkatérbe" kerül, és onnan sugárzik szét. Ugyanilyen szerkezetet találtak a Claude-ban: egy kis belső mintázat-készletet, ami azt mutatja, milyen fogalmak járnak a modell fejében, akkor is, ha egyiket sem írja le. A neve J-space, és példa is van: ha a pók lábairól kérdezed, a modell magában „pókra" gondol, kimondás nélkül.

Részlet az Anthropic tanulmányából: a J-space némán, a modell belső aktivációiban működik, és magától alakult ki a tanítás során

Ez más, mint a chain-of-thought, a modell leírt gondolatmenete: a J-space némán, a belső aktivációkban él, és senki sem tervezte bele, magától alakult ki a tanítás során. A kutatók műszert kaptak, amivel kívülről leolvasható, mit „tart fejben" a modell, mielőtt bármit kimondana.

Vezetőként ezt a safety-kutatás feléd fordított oldalaként érdemes olvasni. A modell eddig fekete doboz volt: láttad, mit mond, és nem láttad, miért. Ha leolvasható, mire gondol a modell, hamarabb kiderül az is, ha mást csinál, mint amit mond, és pont ez a fajta betekintés kell ahhoz, hogy egyre nagyobb feladatokat merj rábízni.

Ha mélyebben érdekel: Mi van a fekete dobozban? · 17 perc · teljes hozzáféréssel
5

Mindenki produktívabb, és mindenki fáradtabb

x.com · @DavidSHolz
munkatempófenntarthatóságcsapat
"my friends are all feeling extremely productive and also extremely drained with the latest coding models. this makes me feel like something is wrong, and also that there might be a big opportunity."

David Holz, a Midjourney alapítója tette fel a hét legőszintébb kérdését. A környezetében mindenki többet szállít, mint valaha, és mindenki kimerült. A magyarázat nagyrészt az előző pickben van: ha a könnyű feladatokat elviszi a gép, a napod csupa nehéz döntésből áll, és a döntés fáraszt. A rutinmunka eddig észrevétlenül a pihenés is volt a döntések között.

Vezetőként ezt érdemes a tempó-kérdés mellé tenni: ha a csapatod az AI-val hirtelen kétszer annyit szállít, az nem jelenti, hogy kétszer olyan jól van. A delegálás készsége mellé a regenerálódás is munkaszervezési kérdés lett, és beszédes, hogy az eszköz-oldal is erre mozdul: a Claude friss visszatekintője csendes órákat és szünet-emlékeztetőket kínál.

A Notion 6118 döntéshozót és felhasználót kérdezett meg arról, hol tart náluk az AI, és az eredmény a legjobb ellenszer a heti hype ellen. A cégek 57 százalékánál az AI gondolkodótárs, 31 százalékánál asszisztens, 10 százalékánál csapattag, és mindössze 2 százalékánál működik rendszerként. A hangos történetek, az „agentek viszik az egész céget" típusúak, ebből a 2 százalékból jönnek. A Notion saját megfogalmazásában: a zaj a szélekről szól, a valódi munka a mérsékelt középen zajlik.

Notion-felmérés, 6118 válaszadó: a cégek 57%-ánál az AI gondolkodótárs, 31%-nál asszisztens, 10%-nál csapattag, 2%-nál maga a rendszer

Ez a négy szint egy az egyben az érettségi modell, amire a kurzus is épül, és a számok két dolgot mondanak. Ha a csapatod ma az 57 százalékban van, nem vagy lemaradva: a többség ott áll. A verseny-előny viszont a 10 és a 2 százalék közti résben dől el most, és oda folyamat kell, nem előfizetés.

És hogy milyen a következő fok, azt ugyanez a cég mutatta meg a héten: a Ship OS-ben a termékfejlesztés a Notionon belül fut, az agentek triázsolnak, rendszereznek és összegeznek, az ember pedig ott ül, ahol a legtöbbet ér: a döntési pontokon.

Ha mélyebben érdekel: Hol tartunk ma? · 13 perc · teljes hozzáféréssel
8

Az AI 2027 szerzői megírták a jó forgatókönyvet is

x.com · @DKokotajlo +1
jövőképgovernancehosszú táv

Tavaly az AI 2027 forgatókönyv járta be a világot: a szerzők szerint a jelenlegi pályán az AI vagy kicsúszik a kezünkből, vagy visszafordíthatatlanul kevesek kezébe koncentrálja a hatalmat. Most megírták a másik felét. Az AI 2040: Plan A az a jövő, amiben szerintük ez jól sülhet el: az emberiség 2040-ig elhalasztja a szuperintelligencia megépítését, az AI-kutatás nyilvánossá válik, és tucatnyi cég zárkózhat fel az élvonalhoz.

Az AI 2040: Plan A nyitóoldala: 2027-re Amerikának két munkaereje van, 165 millió ember és agentek milliói

A nyitókép ismerős lesz ennek a számnak az olvasójától: a szöveg szerint 2027-re Amerikának két munkaereje van, 165 millió ember és agentek milliói, akik óránként pörögnek fel és le. A műfaj nem jóslat: a forgatókönyv gondolkodási keret, arra való, hogy a döntéseidet több lehetséges jövőn teszteld.

További érdekességek

@oneill_c: A múlt heti token-gazdaság szál folytatása: a nyílt GLM 5.2 egyes mérésekben már a hasonló méretű zárt modellek előtt jár, és a szakma azon vitatkozik, mennyit ér a desztilláció mint verseny-előny. A nyílt modellek már képességben is ott vannak, ahol tavaly csak árban voltak.
@FarzaTV: Spatial context: rárajzolsz a saját képernyődre, és a rajz kontextusként megy a modellnek. A screenshot eddig is ment, de a modell nem tudta, hova nézzen rajta; mostantól megmutatod. Apró funkció, nagy tanulság: a kontextus-átadás minden súrlódása megérik egy terméket.
@aakashgupta: Egyórás beszélgetés Meng To designerrel arról, hogyan készül AI-val igényes, nem sablonos design: valódi projekt-mappák, plugin vs skill vs géphasználat a gyakorlatban. Ha a csapatodban bárki AI-val készít vizuális anyagot, ez a hét legjobb egy órája.

A hét egy mondatban

A szálak megint egy irányba mutatnak. Az agent folytonos lett: viszi a munkát, miközben te mozogsz, és napokig kitart egy feladaton. Közben műszerünk lett arra, mire gondol, a kutatás pedig kimondta, hogy a vele való munka vezetés: cél, mérce, ellenőrzés. Ez terheli is az embert, ezért a regenerálódás munkaszervezési kérdés lett. A Starbucks megmutatta, hogy a szoftver mostantól építhető, a Notion számai pedig azt, hogy a többség még a létra alján áll, vagyis az előny most szerezhető meg. A gép már magától dolgozik. A te dolgod eldönteni, mit, milyen mércével, és ki ellenőrzi.

Jövő héten folytatjuk.