Якщо ШІ-агенти почнуть пізнавати світ, як люди, то зможуть пропонувати проривні рішення в різних галузях науки й бути менш упередженими.
Мовні моделі, яких тренували на масивах людських даних, досягли значних успіхів: при правильних промптах такі інструменти як ChatGPT можуть бути корисними у викладанні журналістики, контент-аналізі, написанні креативних текстів. Однак темпи прогресу помітно сповільнюються, адже моделі або вже засвоїли дані з більшості високоякісних джерел, або незабаром засвоять. А оскільки сучасні моделі опираються на наявні людські дані, то й не можуть запропонувати якихось проривних ідей, як-от нових теорем або наукових відкриттів. Тому Девід Сільвер (David Silver), головний науковий співробітник Google DeepMind, та Річард С. Саттон (Richard S. Sutton), професор інформатики в Альбертському університеті (Канада), переконані: ШІ-агентам потрібен новий підхід до навчання. Який саме — вчені описали у спільній статті. Переказуємо основне.
Від ери людських даних до ери досвіду
В еру людських даних взаємодія мовної моделі та людини здебільшого епізодична: користувач щось запитує — ШІ-агент відповідає. Зазвичай з одного епізоду їхньої взаємодії до наступного переноситься або мало інформації, або взагалі нічого, що унеможливлює подальшу адаптацію агента. Натомість люди постійно у потоці дій та спостережень, корегують та вдосконалюють свою поведінку, опираючись на попередній досвід.
Агент, навчений імітувати людське мислення або навіть відповідати як експерт-людина, може переймати людські помилки або упередження. Уявімо, якби ШІ навчали на людських даних та відповідях експертів 5000 років тому — в такому разі агент розглядав би питання з фізики у межах анімізму; 1000 років тому — з позиції теїзму, а 300 років тому — з погляду механіки Ньютона. Щоб вийти за межі таких методів мислення, історія вимагала від людей взаємодії з реальним світом: формулювання гіпотез, проведення експериментів, спостереження результатів та оновлення знань.
Тому, на думку авторів статті, замість поглинання статичних даних потужний ШІ має безперервно контактувати зі світом та вчитися на власному досвіді, як людина. Це дозволить агенту постійно адаптуватися до змін і корегувати поведінку. Наприклад, персоналізований освітній агент може відстежувати прогрес користувача у вивченні нової мови, виявляти прогалини в знаннях, адаптуватися до його стилю навчання та корегувати свої методи викладання.
Можливості агентів під час ери досвіду
За словами авторів, варто урізноманітнити методи винагороди для агентів. Людське оцінювання може бути упередженим або необґрунтованим, тож чому б ШІ ще не покладатися на об’єктивні емпіричні заміри власної ефективності, сигнали, що надходять із самого середовища? Наприклад, на результати іспитів користувача, якщо йдеться про вивчення мови, або покращення показників його сну, якщо людина поставила собі за мету поліпшити фізичну форму? Крім того, користувачі можуть надавати агенту зворотний зв’язок під час навчання, наприклад, про рівень задоволеності. Це дозволить краще налаштувати функцію винагороди. З часом вона може адаптуватися.
У новій парадигмі ШІ почне діяти автономно й не обмежуватиметься людськими формами мислення та комунікації. Це необхідний крок для знаходження нових методів розв’язання проблем за межами традиційного людського аналізу. Як приклад автори наводять систему навчання з підкріпленням AlphaProof, яка, ознайомившись з людськими доказами математичних теорем, згенерувала ще сотні мільйонів нових математичних рішень завдяки взаємодії з формальною системою доведення.
Завдяки тривалішим потокам навчання ШІ буде здатен стратегічно мислити та планувати, що забезпечить йому кращу автономну дієвість. Агенти зможуть оцінити, що необхідно для досягнення поставленої мети, розбивати її на низку менших кроків і ухвалювати рішення, які будуть корисними в довгочасній перспективі.
Будь-яка заздалегідь запрограмована система, включаючи фіксовану систему ШІ, може не усвідомлювати контексту навколишнього середовища і не адаптуватися до мінливого світу, в якому вона використовується. Наприклад, критично важливий елемент апаратного забезпечення може вийти з ладу, пандемія може спричинити швидкі суспільні зміни, або нове наукове відкриття може спровокувати ланцюжок швидких технологічних розробок. Натомість агент, який навчається на власному досвіді, може спостерігати і навчитися обходити несправне обладнання, пристосовуватися до швидких суспільних змін або приймати й розвивати нові наукові та технологічні досягнення. Можливо, ще важливіше, що такий агент зможе розпізнавати, коли його поведінка викликає занепокоєння, незадоволення або стрес у людей, і корегувати її, аби уникнути цих негативних наслідків.
Ризики та виклики ери досвіду
Під час переходу до ери досвіду можуть виникнути певні виклики. Якщо ШІ автономно взаємодіятиме зі світом протягом тривалого часу для досягнення довгострокових цілей, у людей буде менше можливостей втручатися та опосередковувати дії агента. Це вимагатиме високого рівня довіри до агента та відповідальності.
Ймовірно, через відхід від людських даних та способів мислення майбутні системи ШІ стануть складнішими для людського розуміння.
Якщо ШІ здобуде навички стратегічного мислення, довгострокового розв’язання проблем, інноваційних рішень, деякі фахівці втратять роботу.
Втім, є низка інших ризиків, які автори не розглянули у статті. Оскільки мовні моделі належать комерційним компаніям, чи можна гарантувати незалежність результатів автономного агента? Чи буде можливість втручатися в роботу автономної ШІ системи обмеженою і для її власників? Це може стати полем для маніпуляцій та зловживань генерованою інформацією, за які нікого не можна буде притягнути до відповідальності. Великі платформи, як-от Google, вже спонукають користувачів не шукати самостійно інформацію, створену людьми, а покладатися на відповіді, згенеровані ШІ. А пропагандистам і еру людських даних вдається заражати дезінформацією західні ШІ-чатботи. Умови спірної автономності та незалежності агентів можуть загострити цю проблему, якщо інформацію від ШІ почнуть вважати пріоритетною.
Фото: Google DeepMind / Unsplash