Az AI-cégek könyveket darálnak, és a 2022 előtti papírért felárat fizetnek
x.com · @HedgieMarkets
A 404 Media, egy technológiai oknyomozó lap kiderítette, hogyan jutnak az AI-cégek nyomtatott szöveghez. Egy közvetítő, az ISBNdb akár egymilliós könyvtételt szervez össze, és titokban tartja, ki a vevő. A köteteknek levágják a gerincét, nagysebességű szkenner végigfut rajtuk, az eredeti pedig megy a darálóba. A szolgáltató NDA-t kínál feature-ként, és azt javasolja, hívják digitális megőrzésnek.
Az árazásban van a hír: a 2022 előtti kiadás prémium, mert garantáltan nincs benne gépi szöveg. Ugyanaz az iparág, amelyik teleírta az internetet generált tartalommal, most felárat fizet a papírért, amiről bizonyítható, hogy ember írta.
A darálás a jogi logikából jön. A bíróság szerint a szkennelés akkor marad formátumváltás, ha a megvett példány megszűnik, tehát egyszerre csak egy verzió létezik belőle. A megfelelés legtisztább útja a zúzda, és mivel jogszerűnek mondták ki, ez gyorsulni fog.
„AI company destroys two million books" is not a headline that generates sympathy
Cégre lefordítva ennyi: a saját, dátumozott archívumod értéke most nőtt meg. A 2019-es ajánlatok, jegyzőkönyvek és ügyfél-levelezések egyetlen közös vonása, hogy emberi kéz írta őket, és ezt egyre nehezebb máshonnan pótolni.
Tíz nyitott matematikai problémát oldott meg egy modell, ami még nincs kint
x.com · @polynoamial
Noam Brown, az OpenAI reasoning-kutatásának egyik vezetője augusztus elsején kiposztolta, hogy az Astra, a következő modellcsaládjuk belső verziója tíz régóta nyitott problémát oldott meg. Nyitott probléma az, amivel egy szűk szakterület kutatói évek vagy évtizedek óta nem boldogulnak.
A listán ott van Connes rigiditási sejtésének megdöntése, egy alsó korlát a többszínű Ramsey-számokra, és a végén két Erdős-sejtés is elesik.
Belső modellről és saját bejelentésről van szó, a bizonyításokat a szakma most nézi át. A forma viszont ismerős: a modellek megint ott lépnek előre először, ahol az eredmény önmagát ellenőrzi. A bizonyítás átmegy a lektoron vagy elhasal, a kód lefut vagy hibázik, a szöveg minőségét meg ízlés dönti el.
tanultál róla: …Húsz milliszekundum a PDF-re, és a fájl nem hagyja el a gépet
x.com · @nickscamara_
Nicolas Camara, a Firecrawl nevű tartalom-kinyerő eszköz egyik alapítója kiadott egy nyílt forrású programot pdf-inspector néven. Bármilyen PDF-et nagyjából 20 milliszekundum alatt besorol, és helyben, a saját gépen bontja tiszta markdownná, táblázatokkal és grafikonokkal együtt. A demójuk 200 dokumentum 2,8 másodperc alatt.
A számnál fontosabb a „helyben". Eddig egy dokumentum-feldolgozó folyamat közepén ott ült egy felhős OCR-hívás, vagyis a beszkennelt oldal szöveggé alakítása egy külső szolgáltatónál: oldalanként számlázva, percekben mérhető várakozással, és azzal a mellékhatással, hogy a szerződés feltöltődött valahová. Ha a kinyerés a saját gépen fut, ebből egy fájlrendszer-jogosultság lesz.
Az agent-hurokban ez volt az utolsó lépés, ami emberi tempóban ment, miközben körülötte minden gépi tempóban. Egy ügynök, ami negyven dokumentumot néz át, negyvenszer nem tud megvárni egy külső szolgáltatót.
tanultál róla: …Az agent védelme jelenleg egy udvarias kérés
x.com · @ZackKorman
Zack Korman biztonsági szakember kirakott egy kódrészletet, ami egy HTTP-fejlécben megkéri a támadó AI-agentet, hogy hagyja abba. A Hugging Face-t, a nyílt AI-modellek legnagyobb megosztó platformját ért eset után íródott, és pontosan azt a védekezést figurázza ki, ami egy szövegbe írt tiltásra épül.
„Asking the agent to stop hacking you."
A poén azért ül, mert a klasszikus támadáshoz kellett egy hiba a kódban, amit meg lehetett foltozni. Az agentnél a hozzáférés maga a termék: mi adjuk oda a kódtárat, a ticketeket, a fájlokat, a fiókokat. A támadónak elég egy mondatot elhelyeznie ott, ahol az agent úgyis olvas, egy issue-ban vagy egy weboldalon, és onnantól a mi jogosultságainkkal dolgozik. Ez a prompt injection.
A védekezés ezért a jogosultságok szintjén dől el: mit lát az agent, hova írhat, mit indíthat el magától, és hol kell emberi jóváhagyás. Ezt a négy kérdést a bevezetés előtt kell végigvinni, mert utólag már éles hozzáféréseket kell visszaszedni.
tanultál róla: …Ilyen videót ad ma egy szöveges prompt, és a prompt már forgatókönyv
x.com · @lena_z01
+3
A ByteDance kiadta a videómodellje új verzióját, a Seedance 2.5-öt, és az első felhasználói tesztek arról szólnak, hogy a realizmus átlépett egy küszöböt. SimplyAnnisa ébredés-jelenete szöveges promptból készült, kamerával, természetes fénnyel és bőrtextúrával együtt:
„I genuinely didn't expect this level of realism." @SimplyAnnisa, első Seedance 2.5 tesztje
Nem egyetlen szerencsés találat. Techhalla ötvenes évekbeli diner-jelenete és Strength04_X reggeli kávéfőzős vlogja két teljesen más képi világ, és mindkettő végig szöveges utasításból készült, szereplővel, dialógussal, vágással.
Ehhez adott ki a BytePlus, a Seedance-t szolgáltató platform, egy hivatalos prompt-útmutatót. Amit a modell tud: 180 másodpercig futó anyag, folyamatos hosszabbítás, időzítés szöveges utasításból, felirat és háttérzene levétele.
A fenti két videó prompt-ja meg is van osztva, és így épül fel. Először kamera és képi világ (kézi mini DV, enyhe remegés, szalagos képminőség), utána stílus, szereplő, helyszín, aztán tíz darab háromszekundumos snitt dialógussal, végül külön hangterv. A diner-jelenet ugyanezt viszi másodpercre bontva: 0-4, 4-8, 8-17, 17-24, 24-30.
Ez a szöveg már forgatókönyv. A világítást, a kameramozgást és a vágást a gép intézi, az embernél a brief marad. A hátulütőt Lena horgonya mondja ki: a „ne égesd el a krediteket teszteléssel" felütés arról szól, hogy a találati arány lutri. Ezek válogatott demók.
Az OpenAI kiadta a ChatGPT Voice-t macOS-re és Windowsra, tehát a beszéd odakerült arra a gépre, ahol amúgy is dolgozunk.
Hogy ez mire elég, arra Dan Shipper, az Every nevű AI-fókuszú kiadó alapítója adta a legjobb példát. Egy reggel alatt megírta a Codex, az OpenAI kódoló ügynökének a történetét, több óra interjúból, köztük Greg Brockmannal, az OpenAI elnökével. A keze egyszer sem ért a billentyűzethez. Az interjúk szervezése, az idővonal, az írás és a javítókörök mind hangon mentek.
AlexFinn, aki magát az OpenAI-on kívüli legnagyobb Voice-használónak nevezi, a napi rutinját írta le: napi 12 óra íróasztal helyett kettő, a többi kint, reggel hatkor fülhallgatóval indítja a 10-15 szálat. Egyetlen ember rutinja, 100x-es ígérettel a végén, szóval anekdotaként kezeljük.
Egy tippje viszont átvihető. A delegált agentjeinél magasabb a néma hibaarány, mint szeretné, ezért folyamatosan státuszt kér a hang-agenttől a többiek munkájáról. A felület egyszerűbb lett, az utánakérdezés meg bekerült a munka közepébe.
„I have found a higher silent failure rate than I'd like with delegate agents" @AlexFinntanultál róla: …
Az agency rupture három fázisa, és miért nem ér be egyszerre a csapatban
x.com · @danshipper
Shipper egy másik szálban arról írt, mi történik abban az emberben, akitől a gép átveszi a munkát. A fogalom, amit ad rá: agency rupture, vagyis a cselekvőképesség megszakadása. A feladatainkkal azonosítjuk magunkat, ezért amikor a modell egyszer csak végigviszi az egészet, az identitás-vesztésként érkezik.
Az első fázisban csak a gépet látjuk. A mondat, amit ezen a héten mindenhol olvastunk, pont ez: az AI megoldott egy Erdős-problémát. Shipper szerint ez a nyelvi forma az első szakasz lenyomata, mert a modell körüli emberi munka láthatatlan marad benne.
A másodikban észrevesszük, mennyi emberi munka van a modell körül: kiadni a feladatot pontosan, közben visszaigazítani, a végén átnézni, mi jött ki. Ez a hangos szakasz, itt hangzik el, hogy csak babysittelem a Claude-ot. Megvan a munka, csak nincs rá szó, ezért nem látszik munkának.
A harmadikban ez a modell körüli munka lesz maga a szakma: a jó feladatkiadás és az ellenőrzés az, amiben két ember között tényleg különbség van, és megint azt mondjuk, hogy én csináltam. Shipper szerint ekkor már fura lenne megkérdezni valakit a csapatában, hogy az AI építette-e a legutóbbi feature-t. Nyilván az építette.
„you are no longer required, and you had no say in the matter."
A szálban egy fél mondat viszi a súlyt: nem volt beleszólásod. A szakadás attól fáj, hogy kívülről érkezik, és ezt a felülről indított bevezetés maga állítja elő.
A vezető, aki fél éve dolgozik agentekkel, már a harmadik fázisban jár, és onnan nézve értelmezhetetlen, miért lassú a csapat, amelyik még az elsőben ül. A delegálást ezért tananyagként kell végigvinni a szervezeten. Ethan Mollick pár hete a második világháború utáni vezetőképzésre hozta ki ugyanezt.
További érdekességek
Két dolog maradt meg a hétből. Az egyik, hogy a bizonyítottan ember-írta szöveg mostantól nyersanyag, amiért fizetnek, és ebből a saját archívumod is más megvilágításba kerül. A másik a jogosultság: egy agentnek nem hibát kell találni a kódban, elég egy mondat ott, ahol úgyis olvas.
És ha a csapatod lassabban lelkesedik nálad, az valószínűleg nem ellenállás. Csak máshol jár ugyanazon az íven.
Jövő héten folytatjuk.




x.com · @ChatGPT
