Leteszed a laptopot, és a Claude viszi tovább a munkát
x.com · @claudeai
+3
Az Anthropic egy hét alatt annyi funkciót jelentett be, hogy külön hírlevelet lehetne írni belőle, de a bejelentések egy irányba mutatnak. A legnagyobb: a Claude Cowork jön mobilra és webre. A feladatot az asztalodnál adod ki, a kész munkát a telefonodon veszed át: lecsukod a laptopot, és a Claude dolgozik tovább. Az agent eddig egy ablakhoz volt kötve a gépeden; mostantól a munka fut, te pedig mozogsz körülötte.
A felület is egyszerűsödik: a Chat és a Cowork egyetlen Home-fülbe olvadt össze. Eddig előre el kellett döntened, beszélgetni akarsz vagy dolgoztatni; most elkezded a beszélgetést, és ha munkává válik, ott helyben azzá válik. A Claude Code desktopba pedig beépített böngésző került: a Claude doksit olvas, designt néz, kattint és kitölt, ugyanúgy, ahogy a te fejlesztői környezeteddel bánik, homokozóban, a te szabályaiddal.
És két csendes, de sokat mondó apróság. A /checkup paranccsal a Claude Code önmagát takarítja: kidobja a nem használt skilleket és bővítményeket, rendezi az eligazító fájlokat, frissíti magát. A Reflect nevű visszatekintő pedig megmutatja, mire használod a Claude-ot hónapok óta, és felteszi a kérdést: mit akarsz továbbra is magad csinálni, akkor is, ha a Claude gyorsabb lenne benne? Egy eszköz, ami segít meghúzni a saját delegálási határodat: ritka és jó irány.
Ha mélyebben érdekel: Mi az agent? (CRUD a fájlrendszerben)A GPT-5.6 közel egy hétig dolgozott egyedül ugyanazon a feladaton
x.com · @mattshumer_
+2
A másik oldalon az OpenAI hete is erős volt. Matt Shumer megmutatta, mit tud a GPT-5.6, ha időt kap: egyetlen feladatból kiindulva közel egy héten át futott magától, és felépítette Manhattant voxelekből, épületről épületre, hibajavítással, megállás nélkül. A múlt héten a Fable gondolkodási szintjeit mértük egy 3D-s Manhattanen; most a másik labor modellje ugyanazt a várost választotta. A mérce közben megváltozott: már az számít, mennyi ideig tud egy modell értelmesen, felügyelet nélkül dolgozni, a benchmark-pontszám másodlagos.
A gyakorlati oldalt Dan Shipper (az Every alapítója, egy hónapja teszteli) mondja el a legőszintébben: egy hétre elvesztették a hozzáférést, és a Fable mellett is úgy érezte, kőkorszakba került nélküle. Az Every-nél a modell söpri át a bejövő emailt, dönti el, mi érdemel figyelmet, és készíti elő a válaszokat: a napi munka hordozó rétege lett.
És jön a következő lépcső: az OpenAI munkatársa szerint a Sol változat a gép- és böngészőhasználatban világelső, és most kerül be a Codexbe. A két élcsapat fej fej mellett halad, és ez neked jó hír: a folytonosan, napokig dolgozó agent nem egyetlen gyártó kiváltsága, ez lesz az alapfelszerelés.
Ha mélyebben érdekel: A modellek családjaAz Anthropic megtalálta, mire gondol a Claude, amikor nem mondja ki
x.com · @AnthropicAI
+2
Ha egy modell napokig dolgozik egyedül, egyre fontosabb kérdés, mi jár közben a fejében. Az Anthropic friss kutatása erre ad egy meglepő választ. Az idegtudomány régi elmélete szerint az agyban zajló rengeteg folyamatból az válik tudatossá, ami egy kiemelt „munkatérbe" kerül, és onnan sugárzik szét. Ugyanilyen szerkezetet találtak a Claude-ban: egy kis belső mintázat-készletet, ami azt mutatja, milyen fogalmak járnak a modell fejében, akkor is, ha egyiket sem írja le. A neve J-space, és példa is van: ha a pók lábairól kérdezed, a modell magában „pókra" gondol, kimondás nélkül.
Ez más, mint a chain-of-thought, a modell leírt gondolatmenete: a J-space némán, a belső aktivációkban él, és senki sem tervezte bele, magától alakult ki a tanítás során. A kutatók műszert kaptak, amivel kívülről leolvasható, mit „tart fejben" a modell, mielőtt bármit kimondana.
Vezetőként ezt a safety-kutatás feléd fordított oldalaként érdemes olvasni. A modell eddig fekete doboz volt: láttad, mit mond, és nem láttad, miért. Ha leolvasható, mire gondol a modell, hamarabb kiderül az is, ha mást csinál, mint amit mond, és pont ez a fajta betekintés kell ahhoz, hogy egyre nagyobb feladatokat merj rábízni.
Ha mélyebben érdekel: Mi van a fekete dobozban?A prompt-trükkök kora lejárt: célt, mércét és ellenőrzést adj
x.com · @emollick
+2
Ethan Mollick (Wharton) csapata évek óta méri, mi működik a promptolásban, és az eredmény kijózanító: a borravaló-ígérgetés, a fenyegetőzés és a hasonló trükkök hatása a mérések szerint elhanyagolható, főleg a mai reasoning-modelleknél. Ami mérhetően számít: világosan megmondani, mi a cél, milyen formában kell az eredmény, mi számít jónak és rossznak, és hogyan ellenőrizzük. Mollick hozzá is teszi: igen, ez egyszerűen menedzsment.
Ugyanezt a fordulatot két gyakorló vezető is leírta a héten. Jack Dorsey (a Twitter és a Block alapítója) egy mondatban: áttért arról, hogy megmondja az agenteknek, mit csináljanak, arra, hogy megkérdezi őket, mit érdemes csinálni, és a legjobb szálat húzza tovább. A delegálás felső foka: a gondolkodás egy részét is kiadod, és a döntést tartod meg.
Yishan Wong (a Reddit korábbi vezérigazgatója) adja hozzá a mélyebb réteget: amikor minden alacsonyabb szintű feladatot elvégez valami más, ami marad, az csupa magas tétű, hiányos adatú, kétértelmű döntés. A vezérigazgatói szék ettől olyan fárasztó, és az agentek most mindenkinek ezt a döntés-sűrűséget hozzák el, felkészítés nélkül.
A megkülönböztető készség tehát a feladatkiosztás: cél, kontextus, mérce, ellenőrzési pont. Ezt eddig is tanítottuk a vezetőknek, most a kutatás is kimondta, hogy a gépekkel is ez működik.
Ha mélyebben érdekel: Az ideális promptMindenki produktívabb, és mindenki fáradtabb
x.com · @DavidSHolz"my friends are all feeling extremely productive and also extremely drained with the latest coding models. this makes me feel like something is wrong, and also that there might be a big opportunity."
David Holz, a Midjourney alapítója tette fel a hét legőszintébb kérdését. A környezetében mindenki többet szállít, mint valaha, és mindenki kimerült. A magyarázat nagyrészt az előző pickben van: ha a könnyű feladatokat elviszi a gép, a napod csupa nehéz döntésből áll, és a döntés fáraszt. A rutinmunka eddig észrevétlenül a pihenés is volt a döntések között.
Vezetőként ezt érdemes a tempó-kérdés mellé tenni: ha a csapatod az AI-val hirtelen kétszer annyit szállít, az nem jelenti, hogy kétszer olyan jól van. A delegálás készsége mellé a regenerálódás is munkaszervezési kérdés lett, és beszédes, hogy az eszköz-oldal is erre mozdul: a Claude friss visszatekintője csendes órákat és szünet-emlékeztetőket kínál.
A Starbucks saját szoftverre vált, és a tőzsde megmozdult
x.com · @lukepierceops
+1
A Starbucks évente nagyjából 400 millió dollárt költ szoftverre, és a héten bejelentette: az IBM és a Microsoft rendszereiről saját, házon belül épített megoldásokra vált. A hírre az IBM 3, a Salesforce 4 százalékot esett: a piac egy korszak elejét árazta be. Amikor egy kávézólánc olcsóbban épít magának szoftvert, mint amennyiért bérelné, a dobozos szoftver üzleti modellje kap kérdőjelet.
Hogy ez hogyan néz ki a gyakorlatban, azt egy tanácsadó friss projektje mutatja: egy raktártechnológiai cégnek AI-val építettek teljes vállalatirányítást, 130 ezer sor kód, 41 képernyő, 50 adattábla, és az egy rendszer viszi a cég mind a 450 aktív projektjét. Régen ez több éves, több millió dolláros fejlesztés lett volna; most egy kis csapat szállította le, hetekben mérve.
Chamath Palihapitiya évek óta erre a fordulatra épít céget, és a számokat is mellé teszi: a szoftverlicencek piaca évi ezermilliárd dollár, a körülöttük élő bevezetés és tanácsadás négyezermilliárd. Az AI mindkettőt átárazza: a licencet kiváltja a saját rendszer, a bevezetést pedig az agent-vezérelt fejlesztés.
A tanulság méretfüggetlen. Ami a Starbucksnak most érte meg először, az egy hazai középvállalatnak is elérhető: a működésedre szabott eszköz ára fejlesztő-hetekben mérhető, előfizetés-évek helyett. A jó sorrend viszont fordított: előbb értsd meg, mit tud az agent és mi a folyamatod, aztán döntsd el, mit építesz.
Ha mélyebben érdekel: Dashboard-skillA hangos sztorik a szélekről jönnek, a cégek többsége a létra alján áll
x.com · @NotionHQA Notion 6118 döntéshozót és felhasználót kérdezett meg arról, hol tart náluk az AI, és az eredmény a legjobb ellenszer a heti hype ellen. A cégek 57 százalékánál az AI gondolkodótárs, 31 százalékánál asszisztens, 10 százalékánál csapattag, és mindössze 2 százalékánál működik rendszerként. A hangos történetek, az „agentek viszik az egész céget" típusúak, ebből a 2 százalékból jönnek. A Notion saját megfogalmazásában: a zaj a szélekről szól, a valódi munka a mérsékelt középen zajlik.
Ez a négy szint egy az egyben az érettségi modell, amire a kurzus is épül, és a számok két dolgot mondanak. Ha a csapatod ma az 57 százalékban van, nem vagy lemaradva: a többség ott áll. A verseny-előny viszont a 10 és a 2 százalék közti résben dől el most, és oda folyamat kell, nem előfizetés.
És hogy milyen a következő fok, azt ugyanez a cég mutatta meg a héten: a Ship OS-ben a termékfejlesztés a Notionon belül fut, az agentek triázsolnak, rendszereznek és összegeznek, az ember pedig ott ül, ahol a legtöbbet ér: a döntési pontokon.
Ha mélyebben érdekel: Hol tartunk ma?Az AI 2027 szerzői megírták a jó forgatókönyvet is
x.com · @DKokotajlo
+1
Tavaly az AI 2027 forgatókönyv járta be a világot: a szerzők szerint a jelenlegi pályán az AI vagy kicsúszik a kezünkből, vagy visszafordíthatatlanul kevesek kezébe koncentrálja a hatalmat. Most megírták a másik felét. Az AI 2040: Plan A az a jövő, amiben szerintük ez jól sülhet el: az emberiség 2040-ig elhalasztja a szuperintelligencia megépítését, az AI-kutatás nyilvánossá válik, és tucatnyi cég zárkózhat fel az élvonalhoz.
A nyitókép ismerős lesz ennek a számnak az olvasójától: a szöveg szerint 2027-re Amerikának két munkaereje van, 165 millió ember és agentek milliói, akik óránként pörögnek fel és le. A műfaj nem jóslat: a forgatókönyv gondolkodási keret, arra való, hogy a döntéseidet több lehetséges jövőn teszteld.
További érdekességek
A hét egy mondatban
A szálak megint egy irányba mutatnak. Az agent folytonos lett: viszi a munkát, miközben te mozogsz, és napokig kitart egy feladaton. Közben műszerünk lett arra, mire gondol, a kutatás pedig kimondta, hogy a vele való munka vezetés: cél, mérce, ellenőrzés. Ez terheli is az embert, ezért a regenerálódás munkaszervezési kérdés lett. A Starbucks megmutatta, hogy a szoftver mostantól építhető, a Notion számai pedig azt, hogy a többség még a létra alján áll, vagyis az előny most szerezhető meg. A gép már magától dolgozik. A te dolgod eldönteni, mit, milyen mércével, és ki ellenőrzi.
Jövő héten folytatjuk.



