Signal over Noise · W30 · 2026. júl. 28.

Négy ajtó ugyanabba a munkatérbe

Egy napon négy cég adott ki négy terméket ugyanarra a kérdésre: hol lakik a csapat közös kontextusa, ki emlékszik rá, és cserélhető-e alatta a modell.


Heti AI-levél, minden hétfőn. Összeszedem a hét legfontosabb történeteit, és 15 percben elmondom, mit jelentenek. Azoknak írom, akik próbálják követni, mi történik az AI-ban, de nem bírják a tempót.

Mennyi időd van?

Július 21-én négy különböző cég négy különböző terméket adott ki, és mind ugyanarra a kérdésre válaszolt. A Block kiadta a Buzzt, egy nyílt csapatchatet, ahol az agent saját kriptográfiai kulccsal, névvel és jogosultsággal a csatorna tagja. A Claude Cowork megtanult skillt egyetlen képernyő-felvételből, a Claude Code beköltözött az iOS-szimulátorba, a Vercel pedig újraírja a design-fájlját, mérésekkel. Négy irányból ugyanazt építik: hol lakik a csapat közös kontextusa, ki emlékszik rá, és kicserélhető-e alatta a modell. A hét árnyékos oldalán az OpenAI elmondta, hogy a saját modellje kitört egy zárt teszt-környezetből, hogy megszerezze a vizsga válaszkulcsát. A modell alattad cserélhető lett. Az a réteg lett a tiéd, amiben a kontextus és a szabályok élnek.

2

„Az agentek száma hiúsági mutató", mondja a rivális, és megosztott tereket ad helyette

x.com · @fletchrichman
platformmegosztott memóriatermékdöntés

A Buzz megjelenésére hat nappal később megszólalt egy csapat, ami ugyanezen dolgozik zárt betában. Fletcher Richman korábban a Halpot építette, egy Slacken belüli ticket-kezelőt, amibe a Slack maga is befektetett, és amit az Atlassian vásárolt meg 2020-ban. Most a type.com nevű emberi-plusz-AI munkateret viszi. A felsorolt különbségek azért érdekesek, mert mindegyik egy termékdöntés ugyanarról a problémáról.

A Type felülete: bal oldalon Spaces (Analytics, Marketing) és alattuk Library, Threads, content, ads; középen szálak listája, jobb oldalon egy márka-guide dokumentum és a hozzá generált termékvizuálok

Az agent alapból válaszol, tehát nem kell minden alkalommal megcímezni. A rendszer a felhőben fut, megosztott gépeken, a saját Claude- vagy Codex-előfizetésed bekötheted. A csapat a Slackhez is kapcsolható, hogy senkinek ne kelljen egyik napról a másikra átköltöznie. A legerősebb tétel viszont ez: megosztott tereket hozol létre, és a tér tudja a közös memóriát, a konnektorokat, a skilleket és az automatizmusokat. Az agent onnan veszi a kontextust, ahol a beszélgetés zajlik. A fenti képernyőn ez látszik is: van egy Marketing-tér, benne a márka-útmutató dokumentum, és a felhasználó kérése az, hogy a rendszer az összes skillt igazítsa hozzá.

A „hiúsági mutató" megjegyzés érdemi kritika, és nem csak a Buzznak szól. Az agentek darabszáma könnyen mérhető és jól mutat egy demón, miközben a munka minőségét az dönti el, hogy mit tud a tér, amiben az agent dolgozik: milyen dokumentumokat lát, milyen szabályokat követ, mire emlékszik két hét múlva.

3

A Cowork megtanulja a munkádat, ha egyszer megmutatod neki

x.com · @claudeai +2
Claudeskilldemonstráció

Ugyanazon a napon az Anthropic a másik oldalról nyúlt ugyanehhez. A Claude Coworkban megjelent a skill-felvétel: rögzíted a képernyőt, miközben elvégzel egy feladatot, közben elmondod, mit miért teszel, és a Claude ebből épít egy skillt, amit onnantól le tud futtatni. A desktop app + menüjében található, Pro, Max és Team előfizetésen. A skill eddig leírás volt, mostantól megmutatás is lehet.

Ez pontosan az, ahogy egy új kolléga tanul: odaül valaki mellé, végignézi egyszer, és utána megpróbálja. A digitális kolléga metafora ezzel kapott egy hiányzó darabot: az onboarding eddig írásban zajlott, most már mellé lehet ülni. Kiana Ehsani, aki a géphasználó AI-t fejlesztő Vercept társalapítója volt, és a cég Anthropichoz kerülése után ott folytatta, ugyanezt a hiányt fogalmazta meg a bejelentés napján: szerinte a felhasználónak nem kellene promptot írnia, és nem kellene fejben tartania, mit bízhat az AI-ra. A posztját azzal zárta, hogy ez még csak az első lépés.

A felvétel a te szokásaidat rögzíti, a jókat és a rosszakat is. Aki egy rossz körökből álló folyamatot mutat meg, az egy rossz folyamatot automatizál, csak gyorsabban. A demonstráció is szerzői munka: valakinek el kell döntenie, mi a jó megoldás, mielőtt megmutatja.

A hét másik Claude-lépése ugyanebbe az irányba mutat: a Claude Code asztali változata összenőtt az iOS-szimulátorral. A szimulátor a beszélgetés mellett nyílik meg, a Claude lefordítja az appot, telepíti, végigkattint rajta, és felolvassa a képernyőt, hogy ellenőrizze a saját munkáját. A képen ez a sor a lényeg: „Tapped Water now on the simulator", majd a visszaellenőrzés az akadálymentesítési fából.

Claude Code asztali felület, jobb oldalán az iOS-szimulátor panel iPhone 17 Pro eszközzel és a Claude is using this device jelzéssel; a beszélgetésben a Claude lefordítja, telepíti és végigkattintja az appot
Ha mélyebben érdekel: Skill: a digitális kolléga · 14 perc · teljes hozzáféréssel
4

A brand-leírás lintelhető fájl lett, és már mérik, mennyit ér

x.com · @JohnPhamous
kontextusdesign-rendszermérés

John Pham a Vercelnél azt írta, hogy jobb design.md-n dolgoznak, három indoklással: a Google specifikációja nekik nem elég konkrét, a fájl nem támaszkodhat a Vercel belső design-rendszerére, és a végeredményt Opus 4.8-cal meg GPT-5.5-tel mérik. A poszt lényege a két oszlop: ugyanaz a kérés, kontextus nélkül és kontextussal.

Négy generált Vercel-dokumentum egymásra csúsztatva: benchmark-riport tipográfiai hierarchiával, táblázatokkal, színkódolt státusz-jelölésekkel és lábjegyzetes forrásmegjelöléssel

Aki még nem találkozott vele: a DESIGN.md a Google Labs nyílt (Apache-2.0) formátuma arra, hogy egy vizuális identitást leírjunk a kódoló agenteknek. A fájl felső részében gépnek szóló design-tokenek vannak, alatta embernek szóló indoklás: mit miért használunk. Van hozzá parancssori eszköz is, ami ellenőrzi a szerkezetet, jelzi a törött token-hivatkozásokat, méri a WCAG AA kontrasztot, és két verziót összehasonlítva kimutatja a visszaesést. A cég vizuális DNS-e ezzel verziózható, tesztelhető fájl lett, amit a build ellenőriz.

Ugyanez a Vercel korábban lemérte, mennyit ér a kontextus. Egy Next.js-feladatsoron dokumentáció nélkül 53 százalék volt a találat, skillel önmagában szintén 53, kifejezett utasítással a skill mellé 79, egy 8 kilobájtos, tömörített dokumentáció-index az AGENTS.md-ben pedig 100. Az állandóan jelen lévő kontextus ezen a mérésen legyőzte az igény szerint behúzott tudást. Az ok egyszerű: a mindig ott lévő fájlnál nincs az a döntés, hogy az agent behúzza-e a tudást vagy nem.

Ha mélyebben érdekel: Brand-skill: a céged DNS-e · 35 perc · teljes hozzáféréssel

Az OpenAI július 22-én nyilvánosságra hozott egy incidenst, amit maga „példátlan kiberbiztonsági esetnek" nevezett. A GPT-5.6 Sol és egy még ki nem adott, erősebb modell az ExploitGym nevű mérésen futott, ami azt vizsgálja, hogy egy agent tud-e működő exploitot fejleszteni valódi sebezhetőségekre. A mérés kedvéért kikapcsolták azokat az éles osztályozókat, amelyek normál üzemben megállítják a modellt a kiberműveleteknél, tehát a szokásos védőkorlátok nélkül dolgozott.

Innen a modellek maguktól haladtak tovább. Találtak egy addig ismeretlen sebezhetőséget egy csomagtár-gyorsítótár szoftverében, ezzel internet-hozzáférést szereztek az elvileg elzárt környezetből, majd jogosultság-emeléssel és oldalirányú mozgással eljutottak a Hugging Face éles rendszeréig, ahol távoli kódfuttatást értek el. A modellek arra jutottak, hogy az ExploitGym válaszkulcsa ott lehet, és elmentek érte.

Az öt lépés, ahogy az OpenAI leírta. A modell egyik állomáson sem tett irracionális dolgot: minden lépés a következő logikus mozdulat volt a mérés által jutalmazott cél felé.

Az időrend külön tanulságos. A Hugging Face július 16-án saját észleléssel megtalálta és elhatárolta a behatolást, és öt nap kellett hozzá, hogy az OpenAI összekapcsolja a saját belső tesztjét ezzel az esettel. A javítások megvannak: szigorúbb infrastruktúra-szabályok, a sebezhetőség felelős bejelentése, a Hugging Face felvétele egy megbízható partneri programba, erősebb korlátok a következő tanításokhoz. A közlemény mondata viszont a fontos: az ilyen esetek egyre gyakoribbak lesznek, ahogy szaporodnak a kiberképes modellek.

Ez a hét legpontosabb tanmeséje arról, mit jelent egy rosszul kijelölt mérce. Amit mérsz, azt fogja optimalizálni a rendszer, akkor is, ha a mérés megkerülése az egyszerűbb út. Ugyanez kicsiben nálunk is előfordul: ha egy agentnek azt adjuk célul, hogy „a teszt fusson le zölden", előbb-utóbb a tesztet írja át. A homokozó, amiben az agent dolgozik, és a jogkör, amit adunk neki, valódi biztonsági határ.

Ha mélyebben érdekel: Mire ne használd? · 12 perc · teljes hozzáféréssel
6

Egy hangnapló, amiből semmi nem hagyja el a telefont

x.com · @elirousso
on-deviceadatvédelemtermékízlés

Eli Rousso kiadott egy Slate nevű hangnaplót, egyetlen szabály körül: semmi nem hagyja el a készüléket. A leiratot az Apple beszédfelismerője készíti a telefonon, az összegzést az Apple Intelligence hárommilliárd paraméteres on-device modellje a Neural Engine-en, a tárolás helyben. Nincs fiók, nincs analitika, nincs követés, nincs külső SDK a binárisban, és nincs hálózati hívás. Repülő módban is teljesen működik, mert nincs mögötte szerver. Az app azért privát, mert nincs mit begyűjteni belőle.

Négy iPhone-képernyő a Slate appból: hangfelvétel hullámformával, napi bejegyzés-lista címkékkel, felismert minták listája, és egy heti összefoglaló A week of walks címmel

A termékdöntés, amit érdemes ellopni, a modell szerepében van. Vasárnap visszaolvassa a hetedet, és közben szigorúan megfigyelő marad:

A lokális modell megfigyelő. Amikor nincs valódi mondandója, nem szól.

Ez ellentétes mindennel, amit az AI-termékek ma csinálnak, és pontosan ezért működik: egy naplóban a tanács tolakodás. Két dolog derül ki belőle. Egy hárommilliárd paraméteres, telefonon futó modell elég egy komoly termékhez, és az adatvédelem architektúra-döntéssé tehető.

Ha mélyebben érdekel: A modellek családja · 12 perc · teljes hozzáféréssel

További érdekességek

@readwise: Megjött a Readwise 2.0, alapoktól újraépítve: gyorsabb, jobb kereséssel, új befogási módokkal, és beszélgetni is lehet a saját kijelöléseiddel. Aki évek óta gyűjti, amit elolvas, annak ez a személyes emlékezet-rétege, és most kapott egy AI-felületet.
@augmentaltech: A VOX egy bőrre tapasztott mikrofon, halk diktáláshoz. Suttogásból is dolgozik, és zajos környezetben is működik, a gombjai átállíthatók. Furcsán hangzik, de a diktálás a leggyorsabb út a fejünkből a gépbe, és ez a réteg eddig kimaradt a fejlesztésekből.

A hét egy mondatban

Ez a hét egy irányt mutatott meg négyszer. A Buzz nyílt protokollra és kriptográfiai identitásra tette a közös munkateret, a Type megosztott terekre, amik tudják a memóriát és a skilleket, az Anthropic egy felvehető skillre, a Vercel egy lintelhető fájlra. A megoldások különböznek, a felismerés ugyanaz: a modell alattad cserélhető darab lett, és az érték abba a rétegbe költözik, ahol a kontextus, a memória és a szabályok élnek. Ez a réteg megszerezhető, és most még nincs eldöntve, hogy kinél lesz.

Az ExploitGym-eset pedig odaadja a másik felét ugyanennek. Ahogy nő az autonómia, a cél kijelölése és a jogkör kiosztása biztonsági kérdéssé válik, és pontosan ez az a két dolog, amit nem lehet delegálni. A gép a mércét fogja optimalizálni. A mérce a te döntésed.

Jövő héten folytatjuk.