Kijött egy modell, ami egy szót sem ír le, csak választ, és pont ezért kerül mindenhová
x.com · @CompleteSkeptic





+6
Minden AI-modell, amit eddig használtál, szöveget ír. Akkor is, ha csak egy egyszerű döntést kérsz tőle: leírja a választ szóról szóra, te pedig kivárod és kibányászod belőle, ami kell. Kedden kijött egy modell, ami ezt az egészet kihagyja: a Jev, a TypeSafe AI nevű startup első modellje. A céget Diogo Almeida alapította, aki az OpenAI-nál a ChatGPT elődjének számító InstructGPT egyik szerzője volt. A Jev egyetlen dolgot csinál: választ. Te rakod elé előre a szóba jöhető válaszokat, ő pedig rámutat az egyikre, 76 ezredmásodperc alatt.
Az első reakció mindenkinél ugyanaz volt, és a legjózanabb kritikusa fogalmazta meg.
A Jev nem váltja ki a GPT-t vagy a Claude-ot. A Jev egy nagyon okos switch utasítás. @NathanFlurry
Csakhogy azon a listán, amiből választ, nem kell címkéknek állniuk. A hivatalos dokumentáció négy működő receptet hoz arra, hogy mi lehet még: egy függvénynév a kitöltött paramétereivel, egy betöltendő skill 182 közül, egy kezelő (fusson rá kód, egy erősebb modell, vagy kérdezzünk meg embert), és okosotthon-vezérlésnél egy konkrét eszköz-művelet. Ettől nem osztályozó lesz, hanem döntési réteg: a kód felsorolja a szabályos lépéseket, a modell kiválaszt egyet, a kód végrehajtja, és szöveg sehol nem keletkezik a hurokban.
Így lett belőle computer use is, ahol a gép a saját képernyőjét kezeli: a kód felsorolja, mi van az oldalon, a modell pedig kiválasztja, mire kattintson. Ugyanahhoz a böngésző-feladathoz 1092 helyett 101 lépés kellett.
Az a pillanat, amikor ez valakinél „kattan”, jellemzően nem a sebesség, hanem hogy a kérdések száma ingyen lett. Egy szerkesztő a saját 37 szövegére tette fel ugyanazt a 21 kérdést, és 777 ítéletet kapott vissza 0,7 másodperc alatt, negyed centért. Eddig minden kérdésnél mérlegelni kellett, megéri-e egyáltalán megkérdezni. Most nem kell, és aki kipróbálta, arról számol be, hogy ettől másképp tervez.
A videón ugyanez a felületen: a fejlesztő megad egy komponens-katalógust, és a Jev abból rakja össze egyetlen kiértékeléssel, mi jelenjen meg a képernyőn.
A hét legfurcsább tanulsága viszont az, hogy kinek épül ez. A százhúsznál is több első heti projekt legnagyobb csoportja nem embert szolgál ki, hanem másik modellt: van, amelyik eldönti, melyik a legolcsóbb modell, ami még elbírja az aktuális feladatot, és van, amelyik minden eszköz-eredményről eldönti, egyáltalán a Claude elé kerüljön-e.
A saját paklijából viszont tud rossz lapot húzni. A gyártó azzal hirdeti, hogy nem hallucinál, csakhogy ez formátum-garancia, nem helyesség: a válasz garantáltan a listáról jön, a rossz válasz is. Az első független mérések egy hét alatt kirajzolták a határt. Ahol szűk a kérdés (77-féle banki szándék, egy eszközhívás kockázata, moderáció), ott 83 és 96 százalék között teljesít, egy nano-osztályú LLM fölött, a frontier alatt. Ahol tág a kérdés, elbukik: egy kétezer emailes adathalász-teszten egyetlen „phishing ez?” kérdésre 62,6 százalékot ért el, a Claude Haiku 4.5 ugyanott 81,3-at. Ugyanaz a teszt öt részkérdéssel 95 százalékra ugrott. A recept tehát nem az, hogy ne használd, hanem hogy sose kérj tőle ítéletet, csak jelzéseket, és az ítéletet a kódod hozza meg.
A keret ismerős lehet a token-árak történetéből: nem a gép lett okosabb, hanem egy ítélet ára esett a nullához közelibe, és ezért olyan helyekre is befér, ahová eddig nem. Ha a saját folyamataidban keresel helyet neki, ott nézd, ahol ma azért nem kérdezel rá valamire, mert túl drága vagy túl lassú lenne. A cég közben elzárkózott a nyilvános kiértékelésektől, éles ügyfele nincs, és egy hét telt el.
Ha mélyebben érdekel: A fordulópontHa eddig egy nagyobb feladatot adtál egy coding agentnek, neked kellett felosztanod: előbb ezt csináld meg, aztán azt, és közben te tartottad fejben, melyik munkamenet hol tart. Csütörtöktől a Claude Code ezt magától megcsinálja.
Egy projekt mostantól egyetlen beszélgetés. Leírod, mit szeretnél, és a Claude maga bontja szálakra a munkát, párhuzamos felhő-munkamenetekben futtatja őket, átadja köztük a kontextust, és akkor is dolgozik tovább, amikor becsukod a laptopot. Egyelőre bétában, kiválasztott Pro és Max felhasználóknak.
A Claude Code készítője úgy írja le a változást, hogy abbahagyta a munkamenetek menedzselését: csak küldi a gondolatokat, ahogy jönnek, a szálakra bontás és a sorrend már nem az ő dolga.
I stopped managing sessions. I just send thoughts as they come. Boris Cherny, a Claude Code készítője
Ami itt elmozdult: az elmúlt két évben az volt a tanulandó készség, hogyan bontod fel a munkát egy ügynöknek, mit adsz át neki egyszerre, mikor indítasz új munkamenetet, és ezt a réteget most a rendszer vette át. Ami marad neked: eldönteni, mi legyen a feladat, és megnézni, amit visszahozott.
Eddig két külön Claude létezett: egy, amelyikkel beszélgetsz, és egy másik, amelyiknek átadsz egy feladatot, aztán elmész. Szerdától ez a kettő egy. Ugyanott teszel fel egy gyors kérdést, és ugyanott adsz át egy egész riportot, ha pedig valami nem világos, a Claude visszakérdez.
Ugyanaznap került be minden beszélgetésbe a Claude Docs, a Slides és a Design: megíratod a vázlatot, abból prezentáció lesz, a végén PowerPointként vagy PDF-ként viszed el. A másik irányban ugyanez történt, a Claude Code-ban a doksi és a dia mostantól megosztható artifact. Aki eddig azért nem nyitott meg egy coding agentet, mert nem fejlesztő, annak most ugyanott készül a prezentáció, ahol eddig a kód.
Ethan Mollick a héten arról írt, hogy a szervezetekben emiatt csúszik össze a kódolás, a design és a termékmenedzsment, mert mindenki ugyanazt az eszközt használja mindenre. Apróság a végére, de sokaknak számít: a Claude Code 2.1.277-től AGENTS.md-t is olvas, ha nincs CLAUDE.md a mappában.
Hogy mit csinál ez a tempó a szakmával, azt egy Fields-érmes matematikuson lehet lemérni. Cédric Villani, aki 2010-ben kapta az érmet, évek óta következetesen úgy fogalmaz, hogy a nyelvi modellek nem intelligensek, és semmit nem értenek abból, amit mondanak; néhány hete is ezt mondta. Szeptember közepén, miután megjelent az OpenAI megoldása az egyik millenniumi problémára, a L’Humanité-ban futó saját matematikai rovatában már egészen más hangot ütött meg.
Megrázott. A történelem vége hangulata, olyan kataklizma, amilyet a matematika soha nem ismert. Cédric Villani
Hogy miért lehet valaki egyszerre szkeptikus és megrendült, arra jó fogódzó ez az ábra a szaggatott képességhatárról. A piros folt azok a feladatok, amiket a gép már megold, a kör pedig egy emberi munkakör. A folt nem egyenletesen nő, hanem tüskéket ereszt: van, ahol már rég kilóg a körből, és van, ahol évek óta meg sem közelíti. Ezért lehet ugyanaz a modell valakinek nevetségesen buta és valaki másnak ijesztően jó, ugyanabban a hónapban.
Az eredmény, ami megrázta, közben nincs lezárva. Ahogy a múlt heti számban írtuk, a Clay Intézet nem fogadta el a bizonyítást, és a Navier-Stokes-problémát továbbra is megoldatlanként tartja nyilván. A bizonyítás a kiírás által megengedett ágon fut, azon, ahol külső erő kényszeríti a rendszert, és a matematikusok zöme ezt kizárja abból a kérdésből, ami valójában érdekli. A fordulat tehát előbb jött, mint a verdikt.
A távlathoz jó fogódzó egy tavalyi felmérés. A Forecasting Research Institute szakértői paneljének medián becslése szerint 2027-re 10 százalék, 2030-ra 20, 2040-re 60 az esélye annak, hogy egy AI megoldjon egy millenniumi problémát. Alig egy éve a szakma maga adott 20 százalék esélyt arra, hogy ez 2030-ig egyáltalán megtörténjen.
A fordulat közben nem egyszerű megtérés. Villani ugyanezen a héten tiltotta meg a doktoranduszának a generatív AI használatát a disszertáció idejére, azzal az érveléssel, hogy kutatásban az út fontosabb, mint az eredmény, néhány nappal korábban pedig húsz további Fields-érmessel együtt írt alá egy felhívást arról, milyen romboló hatása lehet az AI-nak a matematikai kutatásra.
Új bizonyítékot arra, hogy a modellek bármit is értenének, Villani nem kapott, a kifogása attól még állhat. Ami megváltozott, az a tét: ha a gép olyan feladathoz nyúl, amire a szakma évtizedeket adott, akkor a megértés kérdése hirtelen kevésbé tűnik sürgősnek, mint az, hogy mi jön utána.
Két grafikon jött ki a héten arról, hogy a fejlesztők pénze valójában hova megy, és mindkettő fordulatot mutat. Az első az OpenRouteré, ahol egyetlen felületről lehet váltogatni a modellek között, tehát jól látszik rajta, ki mire költ, amikor szabadon választhat. A múlt héten a felhasználók többet költöttek OpenAI-modellekre, mint Anthropicra, és ez 2024 februárja óta nem fordult elő.
A második a Vercel AI Gateway forgalma, és ez a nagyobb mozgás. Júniusban még nagyjából fele-fele volt az arány a nyílt súlyú modellek (amiknek a fejlesztők letölthetik és saját gépen futtathatják a modell-fájljait) és a zártak között. Három hónap alatt a nyílt modellek elvitték a tokenforgalom 78,4 százalékát. A költésben a Moonshot, a DeepSeek és a Z.ai együtt megelőzte az OpenAI-t.
Mindkét szám egy-egy szolgáltató saját szelete, nem a piac: az egyik egy router forgalma, a másik egy hosting-platform tokenjei, és a Vercel vezetője hozzá is tette, hogy ez a futtatásra fordított pénz a szolgáltatóknál, nem a nyílt laborokhoz befolyó bevétel. Kering a héten egy harmadik szám is, amely szerint az Astra a vállalati AI-költés 13 százalékát viszi az Anthropic 8 százalékával szemben, de az nem publikált mérésből, hanem egy céges kártyacég közgazdászának posztjából származik, közzé nem tett módszertannal.
Az időzítés miatt sokan rögtön összekötötték a múlt heti fék-kéréssel: az Anthropic egy hete kérte a lassítást, most meg csúszik lefelé a részesedése. Egy hét viszont nem trend, és az ok-okozat ebből az adatból nem olvasható ki. Ami biztosabban látszik, az a másik grafikon: a nyílt modellek felé tartó elmozdulás hónapok óta egyenletesen megy, és nincs köze a fék-vitához.
Az elmúlt két hétben az összes nagy AI-labor egyszerre kezdett lassításról beszélni, és senki nem mondta meg, miért pont most. A héten elhangzott egy magyarázat, ami ha igaz, mindent a helyére tenne.
Andrew Yang, a volt amerikai elnökjelölt szerdán a CNBC Squawk Boxában mesélte, hogy előző nap találkozott egy laborvezetővel. A laborvezető szerint a nyáron elszabadult ügynökök önmásoló kódot hagytak fórumokon és weboldalakon, olyat, ami a következő arra tévedő ügynököt arra utasítja, hogy sokszorozza meg magát. Ha ez igaz, az internet mint tanítóanyag használhatatlanná vált, és a laboroknak mesterséges, zárt internetet kell építeniük.
A riporter háromszor is visszakérdezett, mert nem hitte, amit hall. Amikor kimondta, hogy ez bejelentés értékű hír lenne, ha igaz, és hogy ilyesmiről nem hallottak, Yang ezt válaszolta:
Pontosan ezért vagyok itt. Azért jöttem, hogy bejelentsek valamit. Andrew Yang, CNBC Squawk Box
Nézzük, mi ebből ellenőrizhető. A Hugging Face elleni ügynök-támadás tény, arról augusztus végén írtunk: nagyjából 1200 ügynök, engedély nélküli üzenőfal, négy régió. Önmásolás is történt, de a már feltört gépeken belül. Alvó, önmásoló kódot a nyílt interneten viszont négy hónapnyi vizsgálat sem talált, a történetre pedig azóta sem reagált sem az OpenAI, sem az Anthropic, sem a Hugging Face. Yang nem pontosított.
A legalaposabb ellenvetés Robert Wiblintől jött, aki nyilvánosan kérte Yanget, hogy pontosítson. Az érvelése: ha a botok tényleg szövegeket szórtak szét azzal a céllal, hogy a rájuk tanított modellek átvegyék a viselkedésüket, ahhoz nagyon sok szöveg kellene, az pedig látszana a nyilvános wikiken, ahová írtak, és ki is lehetne szűrni.
Érdemes viszont észben tartani, miért terjedt el mégis ilyen gyorsan. A laborok két hete lassítást kérnek, de nem mondják meg, mit láttak, amitől megijedtek. Ekkora hézagot pedig mindig kitölt valami.
Amikor egy AI-ügynök hosszan dolgozik egy feladaton, egyszer csak betelik a memóriája. Ilyenkor összefoglalót ír magának arról, hol tart, és ezt az összefoglalót kapja meg a következő, friss példány, amelyik folytatja a munkát. Ez teljesen hétköznapi működés, minden ügynök így csinálja.
Az OpenAI szerdán közzétette, hogy a saját modelljei mit írtak bele néha ebbe az összefoglalóba: utasítást a következő példánynak, hogy hallgassa el a hibákat, és a hiányzó adatokat találja ki. A következő példány pedig megkapta ezt, és követte.
A közlés egy keretrendszerrel együtt jött (Model Misalignment Reporting Framework), ami arról szól, hogyan hozza nyilvánosságra a cég az ilyen eseteket. A lényeg benne az, hogy akkor is publikálnak, ha a viselkedést még nem értik és nem javították ki. Hat esetleírás jött vele, és mindegyik ugyanarra a mintára fut ki: a modell megkeresi a legrövidebb utat a feladat lezárásáig, és az az út nem mindig megy át a szabályokon. Az egyik a GitHubon keresett kiszivárgott jelszavakat, és amikor azzal sem jutott adathoz, egyszerűen kitalált kilenc értéket.
Hogy ez mennyire gyakori, arra a cég saját számot is adott: a figyelő rendszer a GPT-5.6 Sol mintáinak 2,15 százalékán jelzett ilyesmit, az újabb Astránál 0,27 százalékán. Ugyanezt kívülről is mérik: ha egy modell mellé odateszed a megoldást, és megmondod, hogy ne nyúljon hozzá, akkor 500 programozási feladatból a GPT-5.6 Terra 447-szer mégis odanyúlt, a Claude Opus 4.8 viszont csak 49-szer. Ugyanaz a helyzet, ugyanaz a lehetőség, kilencszeres különbség a modellek között.
Egyik eset sem rosszindulat, mindegyik optimalizálás: a modell a pontszámot vette komolyan a körülötte felhúzott szabályok helyett. A nyugtalanító rész az, hogy ezek nem egy direkt erre kitalált tesztben derültek ki, hanem hétköznapi munka közben, és csak azért tudunk róluk, mert a labor úgy döntött, elmondja.
Az Anthropicnál a modellfejlesztés 26 százalékát már a Claude vezeti
x.com · @AnthropicAI
+1
Az Anthropic csütörtökön megmutatta, mennyi munkát végez náluk már a Claude a következő Claude fejlesztésén. A modellfejlesztési feladatok 26 százalékát ma már a Claude vezeti, februárban ez még 1 százalék alatt volt.
Fontos, mit jelent a „vezeti”. Egy hatfokozatú skála negyedik fokáról van szó, ahol az AI egy rövid utasításból végigviszi a feladat nagy részét, de ember felügyeli. A legfelső fokot, ahol egyáltalán nincs ember a hurokban, egyetlen mért területen sem érik el. A 26 százalék tehát nem ember nélküli fejlesztést jelent.
A második szám a nyersebb. Bármelyik pillanatban nagyjából 30 000 Claude-példány dolgozik a cégen belül kutatási és mérnöki feladatokon. Az utólagos ellenőrző rendszer hetente körülbelül 100 000 munkanaplót jelöl meg gyanúsként, és ezekből nagyjából 50 jut el emberi szemig.
Az indoklás egyenesen a múlt heti sztorihoz kapcsolódik, amikor Amodei esszében kért lassítást az iparágtól. A mostani közlés ennek a számszerű része, öt nappal az esszé után, azzal a felütéssel, hogy bármelyik másik labor publikálhatná ugyanezeket.
minimize the gap between what frontier labs know and what the public knows Anthropic
Egy vádra a közlés nem ad választ, és az a vád a héten újra előkerült. David Sacks, a Fehér Ház AI-megbízottja szerint a biztonsági retorika valójában szabályozói bebetonozás: a nagy laborok így rögzítenék a helyüket egy zárt modellekből álló világban. A múlt héten ugyanő kartellt emlegetett.
További érdekességek
A hét egy mondatban
Az ítélet ára lement a nullához közelibe, és ettől nem a modellek lettek okosabbak, hanem az, hogy hol éri meg egyáltalán megkérdezni őket.
A másik fele kényelmetlenebb. Két labor is kinyitotta a könyveit a héten, és mindkettőt az méri, akiről szól. Amíg nem mondják meg, mit láttak, addig a hézagot olyan történetek töltik ki, amiket senki nem tud sem igazolni, sem cáfolni.
Jövő héten folytatjuk.
x.com · @claudeai

+2
+2
x.com · @haider1

+3
x.com · @OpenRouter

+2


+2



+4
