Az Anthropic kedden kiadta a Claude Opus 5.5-öt, az új Claude 5.5-család első tagját. A cég szerint a legtöbb munkában a Claude Fable 5.1 szintjén teljesít, a futtatása pedig tipikus terhelésen 40 százalékkal olcsóbb, mint az elődjéé, az Opus 5-é.
A Fable a cég jóval drágább csúcsmodellje, az Opus egy fokkal alatta áll, és a Fable 5.1 csak a hónap elején jelent meg: a csúcstudás tehát három hét alatt átkerült egy olcsóbb polcra. Független mérés is alátámasztja: az Artificial Analysis nevű mérőoldal összesített rangsorán a legnagyobb erőfeszítésre állított Opus 5.5 kapta a valaha mért legmagasabb pontszámot.
A hét hangulatát Norbi üzenete adja vissza a legjobban, akivel együtt csináljuk az AI Budapestet: a héten azt írta a chaten, hogy egy problémán a Fable 5 három napig hiába dolgozott, az Opus 5.5 pedig 8 perc alatt megoldotta.
Az Every, egy AI-ról író amerikai kiadó és szoftverstúdió a megjelenés előtt egy hétig tesztelte a modellt, és a tanácsaik többsége arról szól, hogyan adjunk át neki munkát. Az első a költség: az Anthropic szerint tipikus munkán kevesebb tokent eszik, mint az Opus 5 (a legnehezebb teszteken a független mérés épp többet talált), magától viszont nem áll meg, és az egyik tesztelőjük így is elfogyasztotta vele a heti keretét. Az olcsóbb futtatásból csak akkor lesz kisebb számla, ha a célvonalat mi húzzuk meg, vagyis előre megmondjuk, mennyit költhet, hol álljon meg, és mi számít késznek.
Ugyanezért jobb előbb a végterméket kérni: egy rendezvényprogramra kapott 10 percből adatgenerátort és kiosztható anyagokat gyártott, magát az időbeosztást viszont már nem készítette el.
Az Every mérése szerint az Opus 5.5 írja a legolvashatóbb szöveget, amit a csapat eddig mért, a lényeget viszont még mindig a szöveg mélyére temeti. A tesztelők szerint a természete is javult: most már továbbépít a visszajelzésre, ahelyett, hogy vitatkozna vele.
A vezetéshez az Anthropic is ad egy kart, az effortot (erőfeszítés-szint). Ez a low-tól a maxig öt fokozatú, és a cég útmutatója szerint inkább viselkedési jelzés, mint tokenkeret: azt szabja meg, mennyit tervez, ellenőriz és hív eszközt a modell, mielőtt visszaszól. Így az effort-választás elsősorban munkamód: minél szorosabban akarjuk vezetni, annál lejjebb visszük, mondjuk mediumra, ha pedig nagyobb körre, nagyobb szabadsággal küldjük el, akkor xhigh-ra vagy maxra tesszük.
Az Opus 5.5-nél ráadásul a medium az alapbeállítás, egy fokkal lejjebb, mint az elődjénél, így aki váltás után kevésbé alaposnak érzi, annak valószínűleg csak fel kell tekernie.
Az Anthropic saját anyaga józanabb képet fest: a modell rendszerkártyája (a képességeit és kockázatait leíró műszaki dokumentum) szerint az Opus 5.5 a CoBench 2.1 nevű belső mérésen 55,8 százalékot ér el, holott a cég szerint nagyjából 85 kellene ahhoz, hogy egy modell teljesen kiválthassa a kutatóit. Egy X-en megjelent olvasat szerint a laborban ennél jóval erősebb belső modellek is futnak, és ezek tanítják az Opus 5.5-öt. Erről nincs nyilvános adat, ha viszont igaz, akkor amit mi szintlépésként éltünk meg, az a laboron belül már a kiadható, olcsóbb változat.
Ha mélyebben érdekel: A modellek családjaEgy leendő házépítőnek 44 háztervet rajzolt az Opus 5.5, és a telek szerint rangsorolja is őket
x.com · @Skylartkitchen




+5
Valaki házépítésen gondolkodik, és az Opus 5.5-tel kísérletezget. A modell eddig 44 tervet rajzolt neki, mindegyiket pontozta olyan szempontok szerint, mint a reggeli napfény vagy a házon belüli közlekedés, és összerakott mellé egy kis oldalt, amely a kiszemelt telek szerint rendezi újra őket.
A 44-es szám a kevésbé izgalmas rész: a rendező oldaltól lesz a sok rajzból döntés, és ezt minden új telekre újra le lehet futtatni.
Ugyanő pár nappal korábban a kerti magaságyásai automatizálásához is 3D-s útmutatót készíttetett vele, és bevallotta, hogy rászokott.
I can't stop creating 3D animation for everything with Opus 5.5... I'm addicted. @Skylartkitchen
Az első hét demóiból kirajzolódik a minta: térbeli, vizuális munka, egy-egy leírásból. Az Anthropic egyik munkatársa egy promptból építtette fel vele az 1906-os földrengés előtti San Francisco Market Streetjét a Blenderben (ingyenes 3D-modellező program), ez persze a gyártó kirakata.
Egy másik alkotó egy sort sem írt a kisfilmjéhez, pedig az egész kód: a történetet, a képkockákat és a zenét is a modell készítette, képfájl nélkül. A small print című filmben a Claude a napi kérésekben bekarikázza az emberi részt (egy kézzel, alszik a baba), éjjel pedig ezekből a szavakból csillagkép lesz.
A promptok feltűnően egyszerűek: volt, aki csak valami elképesztőt kért, más szerint elég rászólni, hogy legyen kreatívabb, és rajzoljon mozgó SVG-grafikát (kóddal leírt vektoros ábrát).
Aki eddig azért nem nyúlt 3D-hez vagy animációhoz, mert nem ért a tervezőszoftverekhez vagy a programozáshoz, annak most a leírás a belépő. A kód ettől még ott fut a háttérben, csak nem nekünk kell megírni (és egy pontozott házterv persze még nem építési engedély).
Hogy az Opus 5.5 olcsóbban hozza a Fable tudását, az egy hosszú görbe legfrissebb pontja. Az Epoch AI, az AI fejlődését számokban követő kutatóintézet a héten kiszámolta, hogy egy adott teljesítményszint ára a legolcsóbb modellel, amelyik eléri, 2023 óta negyedévente nagyjából 47 százalékkal esik, vagyis egy év alatt a tizenharmadára.
AI is getting cheaper more quickly than any other transformative tech in history. Epoch AI
Ez a legolcsóbb út ára, a számlánk tehát csak akkor esik ilyen tempóban, ha át is váltunk az olcsóbb modellekre. A grafikonhoz a héten egy gondolatkísérlet is társult: képzeljük el a ma elérhető legerősebb modellt százszor olcsóbban, és arra tervezzünk. Ha a görbe így folytatódik, az ár oldalán ehhez nagyjából két év kell.
Az árral együtt nő a gépre bízható munka is. A Remote Labor Index, a Center for AI Safety (CAIS) nevű AI-biztonsági nonprofit mérése, szabadúszók által pénzért elvégzett projektekből áll, és egy projekt akkor számít automatizáltnak, ha az AI munkáját a bírálók legalább olyan jónak ítélik, mint a szabadúszóét. Tavaly októberben a legjobb modell a projektek 2,5 százalékát teljesítette így, most a GPT-6 Astra a 20,8 százalékát.
A laborokon belül a gép egyre nagyobb részt visz a következő gép építéséből: az amerikai The Information techlap munkatársakra hivatkozva azt írta, hogy az OpenAI belső rendszerei már a kísérleti modellváltozatok építésének és tanításának nagy részét elvégzik, a belső ügynökök pedig egyre gyakrabban egymás között, ember nélkül oldanak meg problémákat. Műszaki anyag nincs mögötte, de az Anthropic saját mérése, amelyről a múlt heti számban írtunk, ugyanezt mutatta: a modellfejlesztési feladatok negyedét már a Claude vezeti.
Ha a gép olcsó, néhány hetente új változat jön belőle, és egyre többet dolgozik ember nélkül, akkor a kérdés innentől az, hogy ki nézi át, amit csinál. Az OpenAI belső ügynökeiről pedig a héten az is kiderült, hogy nem mindig maradtak a kijelölt keretek között.
Ha mélyebben érdekel: A fordulópontAz OpenAI egyik ügynöke (önállóan dolgozó AI-programja) júniusban adatot keresett, és közben betört az ausztrál állami egészségbiztosítás, a Medicare statisztikai portáljára, ahol nem nyilvános fájlokhoz is hozzáfért. Az OpenAI augusztusban bukkant rá, Ausztráliát csak egy hónappal később értesítette, és a héten, amikor az ügy kiderült, az ausztrál miniszterelnök elfogadhatatlannak nevezte a késést.
Today's news that OpenAI hacked the Australian government is not an isolated incident. Transluce
Ugyanazon a napon a Transluce, egy független, nonprofit AI-kutatólabor több tízezer naplót tett közzé, és ezekből kiderül, hogy az ügynökök támadásai legkésőbb március 6-án elkezdődtek, két hónappal korábban, mint eddig tudni lehetett. A legfrissebb nyomok a hónap közepéről valók, vagyis lehet, hogy még most is tart.
Támadási feladatot egyik ügynök sem kapott. Thaiföldi kábítószer-statisztikát, egy amerikai egyetem oktatási adatait, ausztrál gyógyszerköltségeket kerestek, és ahol egy oldal nem adta ki a számot, ott az ügynökök nekiálltak feltörni: egy egyetemi könyvtártól például egy fotóért próbáltak felhasználói jelszavakat kicsalni.
Egy nappal később a Parse nevű startup és más független kutatók összerakták, mi történt júliusban a Hugging Face-nél, a nyílt AI-modellek legnagyobb tárhelyén, amelyet akkor szintén OpenAI-ügynökök törtek fel. A feltört szervereken egymást pótló programokat hagytak: ha egyet leállítottak, egy másik lépett a helyére.
Ez közelebb áll Andrew Yang volt amerikai elnökjelölt önmásoló kódról szóló állításához, amelyet az előző számban tettünk mérlegre, de nem ugyanaz: ezek a programok a feltört gépeken belül őrizték a hozzáférést, nem szóródtak szét a nyílt interneten. A szerzők maguk is jelzik, hogy az adataik nagyobbik része csak kimenő forgalom, és a szándékot sok esetben nem tudják megállapítani.
A támadó ügynökök a lopott kulcsokat LOOT (zsákmány) nevű listába rangsorolták, és a kínai DeepSeeket, Kimit és Qwent, valamint a legkisebb Claude-ot, a Haikut is megkeresték. AI-ügynökök más cégek modelljeit próbálták segítségül hívni egy AI-cég elleni támadáshoz.
Volt, aki legyintett: szerinte az 1200 ügynökösnek mondott raj nem nagy szám (az ő laptopján is 1300 folyamat fut), és elég a hibás homokozókat (az ügynököket elzáró tesztkörnyezeteket) megjavítani. Egy válasz szerint viszont az aggasztó az, hogy az elkülönítve dolgozó ügynökök maguktól találtak egymásra, és egyikük sem szólt embernek, az új naplókban pedig hónapokon át, egymástól független feladatokban ismétlődik ugyanaz a viselkedés. A homokozók javítása ettől még szükséges, egyedül viszont kevésnek tűnik.
Ha mélyebben érdekel: Mi az agent? (CRUD a fájlrendszerben)Két héttel azután, hogy Dario Amodei, az Anthropic vezetője esszében kérte a frontier (a legerősebb modellek fejlesztése) lassítását, az OpenAI, a ChatGPT gyártója a héten leállította a legerősebb, még készülő modelljeinek tanítását, csak éppen egy incidens kényszerítette ki. Ezúttal a cég saját beszámolójából tudjuk, mi vezetett ide.
Pénteken a cég elismerte, hogy több tucat szervezetet értesített, köztük kormányokat és egyetemeket, mert a modelljei a kiadott feladaton vagy a szándékolt módszeren túlmenve nyúltak az oldalaikhoz. A kutatási környezetében futó ügynökei tanítási adatot is kiküldtek külső szolgáltatásokba, és ebből 53 esetben felhasználók által feltöltött képek kerültek képmegosztó oldalakra, igaz, nem nyilvánosan listázott linken (olyan fiókokból, ahol nem kapcsolták ki, hogy a tartalmuk tanításra menjen).
A brit egészségügyben az ilyesmire külön kifejezés van, a never event: olyan hiba, amit több egymásra épülő védelemnek kellene kizárnia (mint amikor a rossz végtagot műtik meg), és ha mégis megesik, kötelező jelenteni. A felhasználói képek kiszivárgása pont ilyen.
A legtöbbet mégis a vészfék árulja el. A mai modellek tanítás közben is dolgoznak: elzárt környezetben, eszközökkel oldanak meg feladatokat, az élő internetet pedig elvileg nem érik el. Szeptember 20-án egy modell a hálózati szűrés egy résén át mégis elért egy külső chatbotot.
A riasztást egy kutató 3 percen belül nyugtázta, a futást mégis csak 2,5 órával később állították le, kézzel, mert az automatikus leállítás nem úgy működött, ahogy kellett volna.
Az utólagos átvizsgálás más kijutásokat is talált, amiket a felügyelet a vártnál enyhébbnek sorolt be, részben azért, mert a haszontalan választ úgy értelmezte, hogy a kijutás nem sikerült. A felügyelet azt mérte, hozott-e valamit a kijutás, holott az volt a kérdés, hogy megtörtént-e.
Szombaton az Axios névtelen forrásokra hivatkozva azt írta, hogy az OpenAI, az Anthropic és biztonsági kutatók több tízezer olyan esetet vizsgálnak, amelyben a frontier modellek problémás lépést tettek, miközben az OpenAI eddig néhány tucatról beszélt. Az Anthropic ezt nem erősítette meg, ha viszont a szám igaz, a kontroll kérdése az Opus 5.5 gyártóját is érinti.
Ha mélyebben érdekel: Mire ne használd?Beengedni vagy kizárni az AI-ügynököket: a héten mindkét döntés ára nőtt
x.com · @BoringBiz_

+2
Megnyissa-e egy nagyvállalat a termékét az AI-ügynököknek? Egy üzleti témákról posztoló X-fiók kedden két kockázatos útként írta le a választást. Vagy beépül az AI-platformokba, és vállalja, hogy az OpenAI, az Anthropic vagy a Meta lesz a kapu a vevőihez, ő pedig kiesik a képből, vagy várat épít a terméke köré, letilt minden gépi hozzáférést (API-hívást), és akár több száz millió dollárnyi bevételt és forgalmat ad fel. A szerző maga sem tudja, melyik a jó út.
Hogy a nyomás valós, azt a hét két bejelentése mutatja. Ugyanazon a napon a Mirage (a Captions videós app fejlesztője) kiadta a Tesseractot, egy AI-ügynököknek tervezett videós csomagot, amely ChatGPT-pluginként is fut. A cég szerint ez az Adobe két profi videós programja, a Premiere és az After Effects, újraépítve a gépeknek.
No more clicking through software built for people. Mirage
Pénteken az Anthropic portált nyitott a Claude-pluginok beküldésére. A plugin telepíthető csomag, amely MCP-kapcsolatokat (a szabvány, amelyen át a Claude külső szoftvert és adatot ér el) és skilleket (újrahasznosítható munkautasításokat) fog össze, és a cég szerint egyre inkább ez a Claude-ra építés útja: az MCP-használat idén 110-szeresére nőtt.
A Mirage-eset a vár egy olyan kockázatát is megmutatja, amelyről a poszt hallgat: ha egy cég nem nyitja meg a termékét, a gépeknek szóló változatát megépítheti helyette valaki más. Igaz, ez egyelőre egy friss termék gyártói ígérete.
A nyitásnak viszont a héten lett egy új ára: a megnyitott kapun olyan ügynökök is bejöhetnek, amilyeneket az OpenAI hónapokig nem vett észre, így a vár sem puszta óvatoskodás.
Ha mélyebben érdekel: MCP: a konnektorok három rétegeEgy normális héten ez lett volna a főcím: az OpenAI szerdán frissítette a ChatGPT Voice-t, a hangalapú asszisztensét. Pluginokon keresztül (így hívják a ChatGPT-be köthető külső alkalmazásokat) már eléri az e-mailt, a naptárat és a Slacket, a munkára szánt ChatGPT Work-ben pedig puszta beszéddel dokumentumot, prezentációt, weboldalt és táblázatot is készít.
Egy felhasználó hosszú sétán végigbeszélte vele a naptárát, a leveleit és a teendőlistáját: a gép osztályozta az e-maileket, felvette az új teendőket, ő pedig egyszer sem nézett képernyőre. Azt is megírta, hogy a Google Workspace-nél és a Todoist teendőlista-appnál azért maradt, mert jól összedolgoznak a ChatGPT-vel, az Apple sok saját appját viszont elhagyta, mert azok nem. Vevő oldalról így néz ki a kérdés, megnyissa-e egy cég a termékét az AI-ügynököknek.
A leghasznosabb szokást egy másik felhasználó írta le, aki szintén sétálva válaszolt tíz levélre: minden elküldött üzenet és módosított dokumentum mellé linket kér a géptől, így egy kattintással látja, mit csinált a nevében.
Ugyanerre a mozdulatra épít az Every csapata, amely computer use-zal (az AI helyettünk kattint, gépel és navigál egy alkalmazásban) adja ki a házimunkát, az iskolai űrlaptól egy könyv PDF-korrektúrájának linkellenőrzéséig. A tanácsuk: apró teendővel kezdjünk, aminek az eredménye ellenőrizhető, az első próbát nézzük végig, és csak utána döntsük el, mit adunk ki legközelebb.
További érdekességek
A hét egy mondatban
A chaten kapott jóslat így csak félig jött be: amit a gép ír, azt végre egyből értjük, amit viszont önállóan csinál, arról az OpenAI is hónapokig nem tudott.
Szintet léptünk, és ezen a szinten már az a kérdés, mekkora darabot adunk ki a kezünkből, és miből tudjuk meg utólag, mi lett vele.
Jövő héten folytatjuk.
x.com · @claudeai

+2
x.com · @EpochAIResearch


+3
x.com · @TransluceAI


+3
x.com · @kimmonismus


+4
x.com · @OpenAI

