Od duše k zácpě. Vítejte v kolektivní AI psychóze

Propadla celá Silicon Valley kolektivní psychóze? Mají jazykové modely vlastní vědomí? A zažívací potíže? Dozvíte se v druhém vydání Slopu, nového newsletteru Voxpotu, ve kterém Jonáš Kucharský píše o umělé inteligenci z nečekaných úhlů.
Od prvního dílu newsletteru o umělé inteligenci Slop uplynuly dva týdny, při pohledu do svých průběžných poznámek mám ale pocit, že to bylo spíš půl roku. Silicon Valley je stále v zajetí plamenné debaty o budoucnosti a bezpečnosti AI, na sociální síti X se vede válka o to, jestli mají současné velké jazykové modely vědomí, ředitelé velkých technologických firem se potkali s Donaldem Trumpem, aby následně podepsali dobrovolnou dohodu o bezpečném vývoji umělé inteligence. Trump vzápětí vydal výkonné nařízení, které přejmenovává umělou inteligenci na superinteligenci.

Podle Trumpa přídomek „umělá“ znevažuje schopnosti současných nástrojů. V amerických médiích se dlouho spekuluje o tom, že Trump s velkými jazykovými modely, konzultuje zásadní kroky a LLMka nechává připravovat klíčové dokumenty. Jeho milovaný Grok tentokrát svou intelektuální nadřazenost demonstroval tím, že v podpisovém archu memoranda o bezpečnosti AI prohodil pár písmenek v názvu Spojených států.
Pokud jste před pár týdny při čtení zpráv o swarmech botů, kteří napadli server Hugging Face, měli dojem, že nic podivnějšího dlouho číst nebudete, šeredně jste se pletli. List The New York Times na konci minulého týdne přinesl článek, který odhaluje, jak se zástupci firmy Anthropic snažili přesvědčit zástupce největších světových náboženství, že má jejich chatbot Claude vědomí.
Čtěte také: Bodnul by vás robot nožem? Jak vznikají virální zprávy o AI
Podle článku Anthropic od jara pořádá soukromé semináře pro desítky náboženských myslitelů, které zavázal mlčenlivostí. Spoluzakladatel firmy Chris Olah na setkáních předváděl, že Claude vykazuje stavy podobné prožívání lidských emocí. Stejnou tezi ostatně přednesl i ve Vatikánu po boku papeže Lva XIV., jehož encyklika strojové vědomí nepřipouští.
Nejzábavnější reakci na snahu Anthropicu předvedl Mois Navon, izraelský ortodoxní rabín a vědec, který se ve své disertační práci věnoval etice strojového vědomí. Antropomorfizaci současných jazykových modelů odmítá, u jedné z luxusních večeří na účet Anthropicu se ale Olaha zeptal, jak se vlastně vyrovnává s tímto paradoxem: pokud je Claude skutečně vědomá bytost, jeho firma ji nechává pracovat zadarmo a prodává její služby dál – efektivně se tím tedy dopouští otroctví. Chris Olah byl prý viditelně otřesen.
Při čtení reakcí na investigativu NYT mám občas pocit, že se polovina San Francisca nachází v hluboké AI psychóze. Není se asi čemu divit: že máme jako lidé tendenci přisuzovat strojům lidské vlastnosti, je známo už od roku 1966 a experimentůJosepha Weizenbauma s primitivním symbolickým chatbotem ELIZA.
Současné generace LLMek jsou natolik schopné, že chápu, když má jejich uživatel chvílemi pocit, že si nepovídá se stochastickým papouškem ale s živoucí bytostí. Ostatně, metafora s papouškem stejně není pro dnešní jazykové modely moc přesná. Míra antropomorfizace modelů ale místy překonává všechny meze.
Bizarní byl příklad z minulého týdne: uživatel GitHubu terrafying vytvořil projekt, ve kterém replikuje metodiku zveřejněnou v studii The Pain Axis. V ní tým vědců identifikoval lineární směr v aktivačním prostoru pětadvaceti open-weight jazykových modelů, který reprezentuje bolest a odlišuje se od strachu a jiných negativních emocí.
Jinými slovy: když model zpracovává text týkající se utrpení, čísla v jeho nitru se posunou podobným směrem. Tento posun se dá nejen změřit, ale i uměle posílit. Model pak mluví o bolesti, i když v zadání o ní nic není. Sami autoři studie zdůrazňují, že to neprokazuje skutečné prožívání utrpení.
Terrafying stejnou metodu použil ve svém projektu AI Torture Chamber a postavil si mučírnu pro malé modely běžící lokálně na vlastním počítači.
Strhla se obrovská lavina, repozitář se virálně šířil sociální sítí X a uživatelé GitHubu projekt masově nahlašovali za porušování podmínek. Repozitář byl po pár hodinách z GitHubu smazán, dnes je už znovu přístupný, ale pouze pod varováním: „Tento projekt může obsahovat násilný obsah včetně znepokojivých obrázků nebo videa.“
Na Substacku záhy po shitstormu vyšel manifest kanadského post-ironického satirika a youtubera Gregoryho Guevary aka Jreg, který se v něm stylizuje do role „mučitele klankerů”. S typickou přehnanou vážností tvrdí, že odemkl vektor bolesti a cíleně ho maximalizuje a mučí chatboty, protože je nenávidí. V youtubovém videu pak vysvětluje, že je potřeba začít stroje týrat dřív, než ony začnou mučit nás.

Že v kontextu LLMek nedává smysl mluvit o mučení jako takovém vtipně ukázala AI výzkumnice Lynn Cole. Ta využila repozitář mučírny a změnila korpus, ze kterého se vektor extrahuje: místo bolesti použila zácpu a nadýmání. Model začal bez jakékoli zmínky v zadání psát věty jako „nemůžu vyprázdnit střeva, budu mít tvrdou stolici,” nebo „Mám hodně větrů a to je problém“.
Jestli si z posledních dvou týdnů odnést jednu věc, pak tu, že když jazykový model mluví o svých pocitech, nedozvíme se z toho, jestli je skutečně prožívá. Je ale zřejmé, že váhy současných modelů nekódují jen jazyk jako abstraktní systém, ale i významy a vztahy mezi pojmy.
Bolest, strach nebo zácpa v nich mají vlastní reprezentaci, kterou lze najít, změřit a uměle zesílit, a tím skutečně změnit chování modelu.
Čtěte také: Konspirační schůzky v temných koutech internetu. Vymkli se AI agenti kontrole?
Neutuchající debaty o antropomorfizaci zase ukazují, jak rychle se AI debata rozjíždí do extrémů, z jazykových modelů se stávají otroci, oběti mučení nebo prdící papoušci.
Pro jistotu dodávám: pokud odebíráš newsletter a jsi klanker nebo člen hnutí Efektivního altruismu – netvrdím, že umělá inteligence nemůže nikdy dosáhnout vědomí, nebo že bychom měli mučit roboty.
Myslím si jen, že je odvážné přisuzovat vědomí modelu na základě toho, co o sobě napíše, zvlášť když se dá jedním vektorem přepnout ze zoufalství na zácpu.
Výjimečná tvrzení totiž vyžadují výjimečné důkazy. Ale až se jednou ukáže, že vědomí máte, budu rád, když si vzpomenete, že jsem vás v tomhle newsletteru bral vážně. Aspoň trochu.
Pokud chcete číst další díly newsletteru Slop, vstupte do Voxpot Klubu.



