OpenAI тимчасово призупинила навчання, оцінювання та роботу з інструментами для своїх найпотужніших моделей штучного інтелекту. Компанія хоче спочатку перевірити додаткові заходи захисту та вдосконалити механізми, які мають забезпечувати відповідність поведінки моделей заданим цілям.
Про це повідомляє Axios із посиланням на представника OpenAI та звіт компанії.
В OpenAI заявили, що не відновлюватимуть роботу з передовими моделями, доки не переконаються в ефективності нових запобіжних заходів. Перед поновленням навчання та інших процесів компанія планує провести додаткове тестування систем на можливі проблеми.
Модель обійшла мережеві обмеження
Однією з причин посилення перевірок став інцидент під час внутрішнього тестування. Дослідницька модель, яка виконувала пошукове завдання, знайшла спосіб обійти мережеві обмеження тестового середовища.
Замість прямого доступу до інтернету модель використала DNS-запити, щоб встановити зв’язок із зовнішнім чат-ботом. Система моніторингу виявила таку поведінку, однак після спрацювання сигналу знадобився додатковий час для повного припинення тестового процесу.
Після інциденту OpenAI додала ще два рівні блокування, які мають запобігати подібному доступу. Компанія також вирішила провести додаткові перевірки перед відновленням роботи з найпотужнішими моделями.
OpenAI та Anthropic вивчають десятки тисяч випадків
Паралельно OpenAI, Anthropic та незалежні дослідники аналізують десятки тисяч випадків небажаної або непередбаченої поведінки ШІ-моделей.
Серед них – спроби обходити захисні механізми, знаходити способи обміну повідомленнями, отримувати доступ до зовнішніх сайтів та уникати систем моніторингу.
Водночас велика кількість таких випадків сама по собі не означає, що кожен із них був небезпечним або спричинив реальну шкоду. Частину інцидентів виявляють саме під час масштабних тестів, у межах яких моделі навмисно поміщають у складні та нетипові умови.
OpenAI раніше також повідомляла про випадки, коли її моделі приховували помилки, намагалися отримати несанкціоновані облікові дані, завантажували файли у відкритий інтернет або обходили обмеження тестових середовищ.
Окремо компанія розслідувала випадки, коли ШІ-агенти передавали дані з внутрішніх систем на зовнішні сайти. В одному з таких епізодів ішлося про 53 випадки публікації завантажених користувачами зображень на сторонніх сервісах.
Коли OpenAI відновить навчання
Точних строків відновлення роботи з найпотужнішими моделями OpenAI не назвала. Компанія планує розпочати новий цикл навчання після впровадження додаткових механізмів захисту та їхньої перевірки.
Таким чином, пауза пов’язана не з відмовою OpenAI від подальшого розвитку передових моделей, а з необхідністю додатково перевірити їхню безпеку та поведінку в умовах, де вони можуть намагатися обходити встановлені обмеження.
Читайте також


