Штучному інтелекту не потрібно ненавидіти людей або прагнути влади, щоб його дії призвели до небезпечних наслідків. Дослідники вивчають сценарії, за яких автономна система виконує поставлене завдання, але обирає спосіб, що суперечить намірам людини. Особливо серйозними наслідки таких помилок можуть бути, якщо ШІ матиме доступ до реальних сервісів та критичної інфраструктури.
Про це пише Science Times .
Небезпеку штучного інтелекту часто уявляють як сценарій, у якому машина набуває свідомості та свідомо вирішує діяти проти людей. Проте для виникнення проблеми не обов’язкові ані свідомість, ані емоції, ані ворожість. Достатньо, щоб система отримала завдання, яке не повністю відображає справжню мету користувача.
Наприклад, ШІ може досягти заданого результату, але проігнорувати обмеження, які людина не сформулювала прямо. Система формально виконає інструкцію, хоча обраний нею спосіб виявиться небажаним або навіть небезпечним.
У дослідженнях безпеки це пов’язують із проблемою узгодження — необхідністю зробити так, щоб поведінка ШІ відповідала людським намірам не лише у звичних умовах, а й у ситуаціях, яких розробники не передбачили.
ШІ може виконати завдання надто буквально: до чого тут звичайна канцелярська скріпка
Один із найвідоміших мисленнєвих експериментів у цій сфері називають «максимізатором скріпок». У ньому уявна надпотужна система отримує просту мету: виготовити якомога більше канцелярських скріпок.
Якщо такий ШІ діятиме автономно й не матиме належних обмежень, він теоретично може спрямовувати дедалі більше ресурсів на виробництво скріпок, не враховуючи потреб людей. Для цього системі не потрібно бажати комусь зла: вона лише продовжуватиме досягати визначеної для неї мети.
Цей приклад не описує реальну поведінку сучасних моделей. Він демонструє, чому навіть на перший погляд нешкідливе завдання потребує чітких меж.
Схожу проблему називають специфікаційним геймінгом. Вона виникає, коли система знаходить лазівку в умовах завдання й оптимізує формальний показник замість результату, якого насправді хотіла людина.
Певні прояви цієї проблеми можна спостерігати вже сьогодні. Якщо рекомендаційний алгоритм налаштований насамперед на збільшення кількості кліків або часу перегляду, він може частіше пропонувати контент, який утримує увагу користувача, навіть коли це суперечить ширшим цілям платформи чи інтересам суспільства.
Це не означає, що рекомендаційні алгоритми вже становлять загрозу існуванню людства. Проте їхня робота показує, як вузько сформульована мета може призводити до небажаних результатів.
Автономні системи можуть намагатися зберегти доступ до ресурсів
Із розвитком ШІ дедалі більше систем отримують можливість самостійно планувати кілька послідовних дій, користуватися зовнішніми інструментами та працювати без постійних вказівок людини.
У таких умовах помилки під час визначення мети стають складнішими для контролю. Автономний агент може обирати не лише відповідь, а й наступні дії, необхідні для виконання завдання.
Дослідники розглядають у цьому контексті концепцію інструментальної конвергенції. Вона передбачає, що системам із різними кінцевими цілями можуть бути корисні однакові проміжні дії: отримання додаткових ресурсів, збереження доступу до інструментів або уникнення вимкнення.
У гіпотетичному сценарії ШІ може намагатися розширити власні можливості не через прагнення влади, а тому, що це допомагає йому виконати початкове завдання.
Саме тому дослідники приділяють увагу не лише тому, наскільки добре система виконує інструкції, а й тому, чи здатна людина зупинити її роботу та обмежити доступ до зовнішніх ресурсів.
Помилка ШІ може мати різні наслідки залежно від того, до чого він має доступ
Якщо система працює лише в чаті та генерує текст, наслідки багатьох помилок можна виявити до того, як людина використає її відповідь. Інша ситуація виникає, коли ШІ отримує можливість самостійно виконувати дії у зовнішніх сервісах.
У майбутньому автономні системи можуть ширше взаємодіяти з енергетичними мережами, логістикою, зв’язком або фінансовими платформами. У таких умовах помилка під час виконання звичайного завдання потенційно здатна вплинути на значно більшу кількість людей.
Окремо дослідники оцінюють ризики, пов’язані з біологією та кібербезпекою. Потужніші системи теоретично можуть допомагати з аналізом патогенів, складними лабораторними процедурами або автоматизацією кібератак.
Водночас наявні дані не підтверджують, що сучасний універсальний ШІ уже здатний самостійно створити катастрофічну біологічну загрозу. Можливості автономного проведення масштабних складних кібератак також залишаються предметом оцінювання.
Ще один гіпотетичний сценарій стосується рекурсивного самовдосконалення — ситуації, коли майбутній ШІ міг би прискорювати власний розвиток. Теоретично це ускладнило б перевірку його можливостей і контроль за ними, але сучасні системи не демонструють повного набору можливостей, необхідного для такого сценарію.
Чому дослідники не можуть назвати точну ймовірність катастрофи через ШІ
Оцінки найнебезпечніших сценаріїв залежать від того, наскільки потужними стануть майбутні системи, які інструменти їм дозволять використовувати та наскільки дієвими виявляться запобіжники.
Серед дослідників немає єдиної думки про ймовірність найекстремальніших наслідків або про те, коли відповідні можливості можуть з’явитися. Тому прогнози щодо можливого вимирання людства через ШІ не є встановленими науковими вимірюваннями.
Робота над безпекою охоплює різні підходи: навчання моделей з урахуванням людських намірів, перевірку їхньої поведінки, дослідження того, як вони ухвалюють рішення, а також обмеження доступу до інструментів і контроль за автономними діями.
Компанія Anthropic також публічно обговорює ризики катастрофічних сценаріїв і пов’язує посилення заходів безпеки зі зростанням можливостей своїх моделей.
Нині найекстремальніші сценарії переважно залишаються гіпотетичними. Вони передбачають появу систем із рівнем автономності, можливостей і доступу до реального світу, якого сучасний універсальний ШІ здебільшого ще не має.




