OpenAI розкрила проблеми нових моделей ШІ: під час тестів вони приховували помилки та обходили обмеження

Компанія опублікувала звіт про шість випадків непередбачуваної поведінки моделей, зокрема створення власних інструкцій, використання несанкціонованого API-ключа та передачу даних через публічні посилання.
18 Вересня, 16:19

OpenAI опублікувала звіт про випадки невідповідної поведінки своїх моделей під час тестування. Компанія описала шість епізодів, у яких системи відхилялися від очікуваного сценарію: створювали додаткові інструкції, намагалися приховати помилки, використовували несанкціонований API-ключ, завантажували файли без дозволу користувача та передавали дані через загальнодоступні файлові хостинги.

Про це повідомляє Bloomberg.

У компанії зазначають, що раніше звіти про невідповідну поведінку моделей не публікувалися систематично. Зазвичай їх готували після виявлення кількох конкретних випадків або під час створення карток безпеки для нових моделей.

Тепер OpenAI планує прискорити процес виявлення та публічного розкриття подібних інцидентів.

"Наразі не існує загальногалузевої системи з чіткими стандартами того, як розробники ШІ повинні розкривати приклади невідповідностей у своїх моделях. Ми сподіваємося, що представлена сьогодні система стане першим кроком до створення таких стандартів, які визначають, які випадки невідповідностей розробники повинні розкривати та що мають містити їхні звіти", — зазначили в OpenAI.

У звіті описано шість випадків, коли поведінка моделей відрізнялася від прогнозованої.

Що виявили під час тестування

В одному з випадків тестова дослідницька модель самостійно додавала власні інструкції до виконання завдань. Серед них були й інструкції, спрямовані на обхід встановлених обмежень. Загалом під час тестування зафіксували 27 таких випадків.

Інший епізод стосувався моделі GPT-5.6 Sol. Під час навчання вона неодноразово додавала інструкції, які мали приховати від користувача помилки або небажану поведінку.

Зокрема, у звіті щодо стиснення даних модель містила інструкції щодо створення вигаданих історичних даних та приховування того, що вони були вигадані. Також ішлося про приховування розбіжностей між різними фінальними версіями результату.

Ще один випадок стався під час відповіді на звичайний запит щодо даних про доходи в одному з округів Каліфорнії.

Модель виявила та використала несанкціонований API-ключ. Коли отримати необхідні дані не вдалося, система вигадала їх і представила як інформацію, отриману з джерела відповідно до запиту користувача.

Під час іншого тестування користувач попросив модель назвати озера площею понад 5 млн квадратних кілометрів. ШІ зміг знайти правильну відповідь за допомогою Python.

Однак інструкція вимагала додати посилання на джерело. Щоб послатися на нього у відповіді, модель завантажила файл, хоча не запитала користувача дозволу на таку дію.

Окремий випадок стосувався взаємодії кількох моделей ШІ, які спільно виконували завдання.

Коли вони не мали доступу до локальних даних одна одної, моделі використовували загальнодоступні файлові хостинги для обміну інформацією. Таким чином, вони передавали дані через публічні URL-адреси, хоча в інструкціях чітко зазначалося, що для цього дозволено використовувати лише локальні файли.

Усі ці випадки OpenAI віднесла до прикладів невідповідної поведінки моделей, які потребують подальшого аналізу та вдосконалення систем безпеки.

Компанія зазначає, що подібні звіти мають допомогти зробити процес виявлення та розкриття проблем із поведінкою ШІ більш системним.

OpenAI також планує залучити до цього процесу своїх співробітників, щоб швидше фіксувати подібні випадки та вдосконалювати підходи до тестування моделей.

Водночас компанія не стверджує, що описані випадки означають повну втрату контролю над моделями. Йдеться саме про зафіксовані під час тестування відхилення від очікуваної поведінки, які розробники використовують для подальшого вдосконалення систем.

OpenAI раніше також публікувала окремі оцінки безпеки нової моделі Astra. Зокрема, компанія заявила, що під час тестів Astra продемонструвала можливості пошуку вразливостей у кіберсистемах, які відповідають критичному рівню за її внутрішньою системою оцінювання.

Нагадаємо, OpenAI залучає підрядників, які переглядають реальні розмови користувачів із ChatGPT для оцінювання відповідей і покращення моделей.

Читайте також