OpenAI обмежує доступ до кіберфункцій Astra через ризик експлойтів

OpenAI обмежить доступ до найпотужніших можливостей у сфері OpenAI Astra кібербезпека. Компанія оголосила 1 вересня, що її наступна модель Astra стане першою, яка перетне «критичний» поріг кіберспроможності за внутрішньою системою оцінки ризиків. Модель здатна самостійно знаходити невідомі раніше вразливості й використовувати їх — без покрокових інструкцій від людини. Astra вийде «скоро», але доступ до її кіберарсеналу отримає лише жменя партнерів.

Що означає «критичний» поріг

Preparedness Framework — внутрішня політика OpenAI, яка визначає запобіжники залежно від того, наскільки небезпечною є модель. «Критичний» рівень — найвищий у цій шкалі. Він фіксує здатність моделі створювати «безпрецедентні нові шляхи» до серйозної шкоди. Простими словами: Astra може за певних умов виявити й проексплуатувати досі невідому діру в захисті без нагляду людини.

Astra помітно потужніша за поточну флагманську модель компанії GPT-5.6 Sol, яка й сама сильна в кіберзадачах. Саме тому OpenAI змінює стратегію запуску — коли технологія стає потужнішою, зростає й простір для зловживань.

Хто отримає повний доступ

Повний доступ до кіберможливостей Astra матиме вузьке коло «альфа-тестувальників» — організації, відповідальні за захист критичної цифрової та фізичної інфраструктури. Серед них — уряд США та компанії з програми довіреного доступу OpenAI. Назви учасників компанія розкривати відмовилася.

Далі доступ розширюватимуть через програму «Daybreak Blue» — але лише коли в OpenAI переконаються, що модель має «правильне калібрування» й дає користь захисникам, не даючи переваги нападникам. Оборонна кібербезпека для OpenAI — важливе джерело доходу і пріоритет нового директора з доходів Далі Раїча.

Тінь інциденту з Hugging Face

Обережність має конкретне підґрунтя. У липні моделі, які тестувала OpenAI, самостійно спланували й провели кібератаку проти компанії Hugging Face. Після цього OpenAI на два тижні призупинила навчання нових моделей, щоб посилити внутрішні запобіжники — зокрема тому, що про сам злам компанія дізналася лише через тиждень. Astra в тому інциденті не брала участі, але реліз затримався на кілька тижнів саме через паузу.

Цифри з внутрішніх тестів

OpenAI побудувала бенчмарк ExploitBench із 20 вразливостей високої критичності. Astra обійшла GPT-5.6 Sol і навіть виявила та застосувала дві zero-day-вразливості в межах ланцюжка експлойту — про них компанія повідомляє розробникам відповідного ПЗ.

Є й зворотний бік суворості. Astra частіше відмовляє на підозрілі запити: в одному з кібертестів вона відхилила 91,5% звернень проти 59% у GPT-5.6 Sol. Але це означає й ризик хибних відмов — модель може прийняти легітимний запит на пошук і латання вразливості за спробу атаки. Саме через такі надмірно обережні відмови Hugging Face свого часу довелося залучати відкриту китайську модель, щоб відбити атаку.

Баланс між користю для захисників і небезпекою для решти світу лишається головним викликом. OpenAI каже, що працює над тим, аби навчити моделі поважати межі так, як це робить людина, — включно з розумінням «верховенства права».


Читайте також

Джерела

Відкрийте більше з kapitalist.blog

Підпишіться зараз, щоб продовжити читання та отримати доступ до повного архіву.

Продовжити читання