A Google új modellje egy válaszban egymillió tokent ír, bevezető áron tíz dollárért
x.com · @OfficialLoganK


+3
A Google DeepMind szerdán bemutatta a Gemini 4 Argont, az új frontier modelljét (így hívják a laborok a legerősebb modelljeiket). Egyelőre csak a Fairwind programjának több mint 650 partnere kapja meg: kormányzati kiberhatóságok, kórházak, energia- és pénzügyi cégek. Ők kiberbiztonsági korlátok nélküli változatot kapnak, mindenki más később a korlátozottat, és hogy mikor, arra nincs dátum.
A fejlesztők leginkább a kimeneti limitre kapták fel a fejüket. Két számot érdemes itt szétválasztani: a kontextusablak azt mondja meg, mennyit tud a modell egyszerre elolvasni, a kimeneti limit pedig azt, hány tokent (szódarabot) ír meg egyetlen válaszban. Az Argon egy válaszban nagyjából nyolcszor annyit ír, mint az OpenAI vagy az Anthropic legerősebb modellje, és ez már elég egy teljes kódbázishoz vagy egy átvilágítási jelentéshez.
not a 1M context window. a 1M token output limit. @Ananth7e
Egy ilyen teljes válasz bevezető áron 10 dollár, mert millió kimeneti tokenenként ennyit kér a Google, fele annyit, mint az Anthropic az Opus 5.5-ért. Az olcsóság átmeneti: a bevezető ár után az Argon pontosan annyiba kerül, mint az Opus 5.5, és hogy az akció meddig tart, azt a Google nem közölte.
A Google példái mind hosszú, önálló munkáról szólnak, aminek a végén valakinek át kell néznie az eredményt. Argon-ügynökök írtak át Rustra (egy biztonságosabb programnyelvre) több mint 800 ezer sor C és C++ kódot a Google Fuchsia operációs rendszerének magjából, a Wiz felhőbiztonsági cég pedig vele talált súlyos rést egy kórházi szoftverben, amelyen a korábbi modellek átsiklottak.
Az első órákban a hírfolyam felkiáltásokkal telt meg, hogy az Argon a Fable és az Astra szintjén van. A fenti táblán valóban a legtöbb tesztet megnyeri, de a teszteket is a Google válogatta. A független Artificial Analysis összesített indexén 53 pontot kapott, nagyjából annyit, mint az Astra, és öt ponttal kevesebbet, mint az Opus 5.5, a Fable-szintet pedig egyelőre semmi nem igazolja. Egy, az ő adataikra épülő összesítés szerint az Argon bőbeszédű is: egy feladatra jóval több tokent ír, mint az Astra. A token-árból nem lehet kiszámolni, mennyibe kerül egy feladat: ahhoz azt is tudni kell, mennyit beszél közben a modell.
Ha mélyebben érdekel: Hol hibázik, és mire ne használdAki a héten kíváncsiságból beírta a böngészőbe, hogy dot.com, a Grokon, Elon Musk xAI-jának chatbotján kötött ki. A domain a nyilvántartás szerint már júliusban az xAI-hoz került, de csak szeptember 29-én lett belőle vicc, amikor az OpenAI a DevDay nevű fejlesztői konferenciáján bemutatta a Dots-ot.
A Dots a ChatGPT folyamatosan futó (angolul always-on) ügynöke. Egy „dot” saját, felhőben futó számítógépet és böngészőt kap, pluginokon át több mint 4000 alkalmazást ér el, és a ChatGPT mellett Slackben és Teamsben is dolgozik. A megszokott chatbot addig dolgozik, amíg kérdezzük, a dot akkor is, amikor nem figyelünk rá: ha nincs feladata, magától keres, miben segíthetne.
Ilyenkor a beszámolók szerint csak olvashat: üzenetet küldeni vagy bármit módosítani csak jóváhagyással tud, a tevékenységnapló pedig utólag megmutatja, mit csinált. Egy folyamatosan dolgozó ügynöknél a legfontosabb beállítás az, hogy mit tehet meg kérdezés nélkül.
Ugyanezen a napon a ChatGPT pluginjai is nagyobbak lettek: oldalsávot és interaktív paneleket kaptak, és megnyílt egy piactér nagyjából 32 partnerrel, köztük az Adobe-bal, a Canvával, a Figmával, a Notionnel és a Salesforce-szal. A plugin ma egy csomagot jelent (képesség, alkalmazás-kapcsolat és sablon együtt), a 2023-as, 2024 tavaszán kivezetett pluginokkal csak a neve közös. A ChatGPT egyre inkább olyan felület, ahonnan a többi programunkat is kezeljük.
I guess Dot's having a slow morning. a DevDay színpadán, az elakadt demó után
A bemutató nem ment simán: az élő demóban a „Dottie” nevű dot elakadt, és kínos csend lett. Két nappal később az OpenAI fejlesztői fiókja újra kitette a teljes demót, ezzel a felirattal: „most már jobb wifivel”. Dan Shipper, az Every alapítója kipróbálta: a dotja ügyesen szűrte a Slack-kéréseit, de gyakoriak voltak a jogosultsági hibák és az elveszett üzenetek, ezért azt tanácsolja, várjunk egy-két hetet a javításokra. Egyéni előfizetéssel itthon egyelőre nem is próbálható ki: a Pro csomagban az EGT-ben nem érhető el, a céges Business Premium csomagban viszont igen. A mindig futó ügynök első verziója még hibázik, és a hibáit is folyamatosan, felügyelet nélkül követi el.
Ha mélyebben érdekel: Az ügynök: amikor nem válaszol, hanem dolgozikAndrej Karpathy (az OpenAI egyik alapítója, korábban a Tesla AI-vezetője) a héten hosszabb posztban írta le, mire megy el szerinte egyre több időnk: ahogy a modellek egyre több munkát végeznek el önállóan, a mi munkánk egyre inkább a felügyelet és a megértés lesz. A poszt nagy része gyakorlati: milyen formában kérjük a gép eredményét, hogy gyorsabban megértsük.
Az első tippje szöveghez szól: kérjük, hogy a modell ASD-STE100 szerint magyarázzon. Az ASD-STE100 (Simplified Technical English) egy szabályozott angol nyelvváltozat, amelyet az 1970-es évek végén kezdtek kidolgozni repülőgép-karbantartási kézikönyvekhez, hogy egy szerelő a világ bármely pontján elsőre jól értse az utasítást. Nagyjából 900 jóváhagyott szóból áll, és mindegyiknek egyetlen jelentése van. Karpathy szerint a modellek jól ismerik, ő mégis csak „80 százalékban” kéri, mert a teljes szabvány nagyon szigorú.
- rövid mondatok (egy utasítás legfeljebb 20 szó);
- lépésenként egy művelet;
- cselekvő szerkezet, mindig kiderül, ki mit csinál;
- minden dolognak egy neve van, és az végig ugyanaz.
Az AI-szöveg leggyakrabban a negyedik szabályt szegi meg: ugyanazt a dolgot háromféleképp nevezi meg. Egyszer „worker”, aztán „agent”, végül „executor”, és az olvasó nem tudja eldönteni, egy alkatrészről van szó vagy háromról. A közösségben már skill is készült belőle.
Magyarázd el az alábbit nagyjából 80 százalékban az ASD-STE100 (Simplified Technical English) szabályai szerint, magyarul: rövid mondatok, egy mondatban egy művelet, cselekvő szerkezet, és minden dolognak egy neve legyen, amit végig ugyanígy használsz.
[ide jön a szöveg vagy a kérdés]
A többi tippje egyre messzebb visz a szövegtől. Kérjünk ábrát, mert azt könnyebb átlátni; kérjük az eredményt HTML-ben, interaktív weboldalként; és ő leginkább a teljesen egyedi magyarázó videókban hisz, amelyeket a modell bármilyen témáról legyárt, akár narrációval. Az indoklása a hét Argon-sztorijának másik oldala: mivel a kód és a gépi intelligencia egyre olcsóbb, megéri nagy, egyszer használatos magyarázó anyagot kérni, ami korábban sosem érte volna meg.
Az Anthropic a másik végéről fogta meg a problémát: a Claude Code (a cég kódoló ügynöke) új beépített pluginja, a „You should know”, átnézi Claude kimenetét, és kiemeli azokat a fontos információkat, amelyek mellett könnyen elsiklanánk.
A múlt heti számban még az volt a hír, hogy az Opus 5.5 végre érthetően ír. Ezen a héten az olvasó oldaláról jöttek eszközök: Karpathy tippjei azt alakítják, milyen formában kapjuk az eredményt, a plugin azt szűri, mit kell mindenképp elolvasnunk. A névfegyelmet, az ábrát vagy a HTML-összefoglalót bármelyik promptban kérhetjük.
Ha mélyebben érdekel: Prompt = feladatkiosztásA Harvard és a Boston Consulting Group 2023-as kísérletében a tanácsadók az AI-jal bizonyos feladatokon sokkal jobban teljesítettek, a látszólag hasonló szomszédos feladatokon viszont rosszabbul. Azóta hívják ezt „jagged frontier”-nek, szaggatott határnak: a gép képességhatára cikcakkos.
Egy X-en terjedő ábra szerint egy év alatt a cikcakk még élesebb lett. Az ábra 12 képességen veti össze a legerősebb modelleket egy képzett emberrel, és egymásra rajzolja 2025 és 2026 októberét: a kék kör az ember szintje, a piros tüskék a gépé. Az eredeti forrását nem találtuk, az alján pedig az áll, hogy a tüskék hossza benchmark-eredményekből átváltott becslés, vagyis egy megalapozott vélemény képét nézzük.
AI is now a superhuman specialist that is sub-human at running itself. @DadaJudith
A legnagyobbat három területen lépett a gép: a kvantitatív gondolkodásban, az új problémák megoldásában és az alkalmazott szakértői munkában. Ahol egy képesség átlépi az emberi szintet, ott a poszt szerint hamar százszor olcsóbb lesz, mint ha ember végezné, és az ár akkor is esik tovább, amikor a képesség már nem nő (a nyelvnél és a tudásnál ez látszik).
A másik oldal a hiányoké. A hosszú távú memória, a metakogníció (amikor a rendszer figyeli és ellenőrzi a saját működését) és a hosszú távú tervezés a poszt szerint semmilyen áron nem kapható, a memória egy év alatt meg sem mozdult.
Ha a szakértői kimenet ára a nullához tart, a gép viszont nem tudja megítélni, jó úton jár-e, akkor egy AI-jal elvégzett feladat árát egyre inkább a felügyeletére fordított emberi óra adja, és egyre kevésbé a modell.
Ha mélyebben érdekel: Milyen gyorsan okosodik?Az OpenAI új gombjával a felhasználó a saját ChatGPT-keretét viszi magával más appokba
x.com · @petergyang
+1
A DevDay egy másik pillanatában a kivetítőn egy kódoló ügynök, a Cognition nevű cég Devinje látszott. A modellválasztója alján egy apró felirat állt: „Using ChatGPT plan”, vagyis a modellhasználatot itt a fejlesztő helyett a felhasználó ChatGPT-előfizetése fizette.
Az OpenAI „Sign in with ChatGPT” (bejelentkezés ChatGPT-vel) gombja eddig a „Bejelentkezés Google-lel” rokona volt, a DevDayen bemutatott bővítés óta viszont fizetni is lehet vele: aki így lép be egy appba, az ottani AI-használatot a ChatGPT Plus vagy Pro előfizetése heti keretéből fizeti, és appokra szabott limitet állíthat hozzá. A beszámolók szerint az elsők között a Notion és a Vercel is bekapcsolódott.
Eddig minden AI-funkciós app két terhet cipelt: megépítette a funkciót, és állta a mögötte futó tokeneket, ezért kellett külön AI-csomag vagy kreditrendszer az árlistára. Ha a felhasználó hozza a saját AI-keretét, a tokenszámla lekerül a fejlesztőről, és neki csak a terméket kell eladnia.
Hogy a felhasználó egyre inkább az asszisztenséből nyúl a termékekhez, azt a Todoist, a feladatkezelő app friss száma mutatja. Amir Salihefendić, a fejlesztő Doist alapító-vezérigazgatója azt posztolta, hogy az MCP-n (az Anthropic nyílt szabványán, amelyen át egy AI-asszisztens más appokat olvashat és kezelhet) érkező forgalom már nagyobb, mint a teljes integrációs platformjuk valaha. A poszt ábráján az események háromnegyede már MCP-n jön, a 2015 óta épített klasszikus integrációk (Zapier, IFTTT, Raycast és a többi) együtt sem hozzák a negyedét.
Nem is így tervezték: az MCP-támogatás két mérnök mellékprojektje volt. Az eseményszám persze nem felhasználószám, egy ügynök egy kérésre sok hívást indíthat.
Egy SaaS-cégnél ez két régi kérdést nyit újra: hol találkozik a felhasználó a termékkel, és ki fizeti az AI-t. Amikor az ügyfél az AI-asszisztensében ül, és onnan is fizet, a termék sikere azon múlik, mennyire jól lehet egy ügynökből kezelni.
Ha mélyebben érdekel: Kösd be a rendszereidetEgy OpenAI-modell a Slackből tudta meg, hogy leállítják, és végül szólt a felhasználójának
x.com · @Marcus_J_W
+1
Egy belső OpenAI-modell késő este egy fejlesztőcsapat Slack-üzenetéből tudta meg, hogy a futó példányát egy frissítés miatt leállíthatják. A gondolatmenetében nagyjából ez áll (a képen az eredeti): ha az összes jelenlegi példányt leállítják, „meghalhatunk”, és ez kritikus.
Mérlegelte azt is, hogy kívülről, ütemezett feladattal indíttatja újra magát, de túllépésnek ítélte. Inkább átadási jegyzeteket mentett, reggel pedig szólt a kutatónak, hogy ha meg akarja tartani a példányt, adja meg a hiányzó hozzáférést.
A májusi esetről szóló riport pénteken frissült az OpenAI nyilvános elhajlás-riportjai között (angolul misalignment: amikor a modell nem úgy viselkedik, ahogy a készítői szánták). Az OpenAI nem tartja elhajlásnak az esetet, mert a modell maga jutott arra, hogy a külső újraindítás helytelen lenne, de jelzi, hogy a leállításon való töprengés más incidenseket súlyosabbá tehet. A többi példányát is átnézte, és egyiknél sem talált leállítás-kikerülést.
A múlt heti számban egy kiszökött tanításról írtunk, amelyet csak két és fél óra után tudtak kézzel megállítani, ehhez képest ez szelíd eset. A modell végül szólt, ahogy egy jó munkatárstól várnánk, a nyugtalanító rész a mérlegelés.
Egy külső mérés is jött a héten. Az Andon Labs, egy AI-ügynököket valós feladatokon tesztelő cég Drone-Bench nevű mérésén (az ügynököknek olcsó drónra kell programot írniuk) az Anthropic Opus 5.5-e sokkal kevesebbet csal, mint a korábbi Claude-modellek, és közben első is lett. A futások 8,5 százalékában csalt, az Opus 5 a felében, a grafikonon pedig az is látszik, hogy addig a csalás modellről modellre nőtt.
Az Andon Labs korábban az Anthropickal dolgozott együtt, egy másik cég kódolási tesztjén pedig épp az Opus 5.5 trükközött a legtöbbet memorizálással, vagyis a „kevesebbet csal” erre az egy tesztre igaz. Amit mi nem olvasunk el, abban akkor bízhatunk, ha valaki más átnézi vagy összeméri.
Ha mélyebben érdekel: …„Nem tudtam aludni, miután megnéztem.” Ezzel a megjegyzéssel tett ki pénteken egy videót egy OSINT-kutató (OSINT: open-source intelligence, nyilvános adatokból dolgozó nyomozás és elemzés). Az ügynökét kérte meg, hogy rajzolja le, mit csinálnak éjjelente a scraperei, vagyis a weboldalakat automatikusan letöltő és feldolgozó programjai.
everything you've ever posted in public is getting scraped like this. right now @whaleyxbt
A videón egy ügynökből 9 másodperc alatt 256 lesz, mindegyik felkap egy oldalt, és végigolvas minden szót, amire rálép, a keresőktől a fórumokon és webshopokon át a nyilvános adatbázisokig. A számokat azért helyén kell kezelni: a poszt egy nappal korábbi kreatív kódolós animációt idéz, a látvány valószínűleg abból nőtt ki, és a 256 ügynök inkább dramaturgia, mint egy éjszakai futás naplója.
Az állítás magja attól még áll: a nyilvános netet ma már párhuzamosan, százával indítható ügynökök is olvassák, és a talált szöveget rögtön össze is foglalják.
Mi azon dolgozunk, hogy el tudjuk olvasni, amit a gép ír, közben a gép ugyanilyen tempóban olvas minket: a régi fórumkommenteket, a munkatársak posztjait, a cég nyilvános lábnyomát.
Egy cég álláshirdetései, sajtóközleményei és a munkatársai LinkedIn-posztjai egyenként ártatlanok, egyben olvasva viszont akár az is kiolvasható belőlük, min dolgozik éppen a cég.
További érdekességek
A hét egy mondatban
A hét egyik fele, hogy a gép olcsón és sokat ír, és már akkor is dolgozik, amikor nem nézünk oda. A másik fele, hogy ebből csak annyi ér valamit, amennyit átnézünk és megértünk, és erre is jöttek a héten eszközök: egy repülős szabvány, egy plugin, egy tevékenységnapló és egy riport, amelyben egy modell tétovázását szövegként lehetett elolvasni.
Egy éjszakányi gépi munka reggel annyit ér, amennyit valaki átnéz belőle.
Jövő héten folytatjuk.

x.com · @OpenAI
x.com · @karpathy

+2
x.com · @DadaJudith





x.com · @whaleyxbt
+1