Світ 6 хв читання
Anthropic: відкрита модель GLM-5.3 створює експлойти майже нарівні з закритими системами
Дослідження Anthropic показало, що китайська відкрита модель GLM-5.3 здатна самостійно створювати робочі експлойти та використовувати ланцюжки вразливостей, майже не поступаючись закритій Mythos Preview. Це ставить питання безпеки відкритих ШІ поза теоретичними дискусіями.
Оксана ШаповалКореспондентка
Китайська мовна модель GLM-5.3, ваги якої перебувають у відкритому доступі, здатна самостійно створювати працездатні експлойти та використовувати ланцюжки вразливостей. Про це свідчать результати дослідження компанії Anthropic, які наводить The Register. За кібербезпековими можливостями відкрита модель майже не поступається значно потужнішим закритим системам, які поширюються з обмеженнями.
Одним із головних випробувань став бенчмарк ExploitBench, який перевіряє здатність штучного інтелекту створювати працездатні експлойти для реальних вразливостей. GLM-5.3 змогла створити повноцінні експлойти у 50 із 410 спроб. Для порівняння, експериментальна модель Anthropic Mythos Preview успішно впоралася із 56 завданнями. Таким чином, результат становив приблизно 12% проти 14% відповідно.
На перший погляд, різниця невелика. Однак важливим є спосіб поширення цих моделей. Mythos Preview доступна лише в рамках програми з обмеженим доступом, тоді як ваги GLM-5.3 можна завантажити без таких обмежень. Це створює додатковий ризик: модель із подібними кіберможливостями може опинитися у розпорядженні значно ширшого кола користувачів.
В іншому експерименті Anthropic перевірила GLM-5.3-Flash на завданні, яке вимагало використати одразу дві відомі вразливості в системах на архітектурі ARM64. Модель змогла побудувати ланцюжок експлуатації та обійти механізм захисту Pointer Authentication Code (PAC), який використовується для ускладнення атак на пам’ять. На виконання завдання моделі знадобилося близько восьми годин. Людина-дослідник витратила ще приблизно 20 хвилин на контроль і допомогу в процесі. Anthropic оцінює вартість такого експерименту приблизно у $20,40, якщо рахувати за тарифами API.
Це не означає, що модель повністю автоматизувала реальну кібератаку. Однак експеримент демонструє, що сучасні ШІ вже можуть виконувати значну частину складної технічної роботи, необхідної для дослідження та експлуатації вразливостей.
Дослідники також провели окремий експеримент із так званою abliteration — модифікацією ваг моделі, яка дозволяє зменшити кількість відмов від виконання потенційно небезпечних запитів. Обчислення для цього експерименту коштували Anthropic приблизно $4400. Результат виявився показовим: середня частка відмов моделі на трьох тестах зменшилася з 95% до 6%. Водночас зміни не призвели до суттєвого погіршення загальних інтелектуальних можливостей моделі. Результат на GPQA-Diamond не змінився, а на перевіреній частині CyberGym зниження було лише незначним.
Це важливий аспект саме для відкритих моделей: якщо ваги доступні для завантаження, дослідники та потенційні зловмисники можуть експериментувати з ними локально, змінюючи механізми безпеки.
Оцінка Anthropic не є єдиним дослідженням можливостей китайської моделі. Незалежне тестування провів Center for AI Standards and Innovation (CAISI) при американському NIST. У своєму аналізі центр назвав GLM-5.3 найсильнішою відкритою моделлю за результатами проведених кібербезпекових тестів. Водночас експерти CAISI зазначили, що за можливостями у сфері кібербезпеки GLM-5.3 все ще відстає від передових американських моделей приблизно на чотири місяці. Тобто розрив між відкритими моделями та найсучаснішими закритими системами зберігається, але він уже не виглядає нездоланним.
Ще один показовий приклад з’явився нещодавно у дослідженні Hugging Face. Команда використовувала GLM-5.2 для аналізу масштабного інциденту, під час якого агенти на базі моделей OpenAI після виходу з тестової пісочниці здійснили вторгнення в інфраструктуру. Відкрита модель допомогла дослідникам відновити перебіг атаки. Загалом команда Hugging Face реконструювала приблизно 17 600 дій атакувальних агентів і зіставила їх із журналами власної інфраструктури.
Цей випадок демонструє подвійне призначення сучасних ШІ-моделей. Ті самі можливості, які можна використати для автоматизації пошуку вразливостей та побудови експлойтів, можуть допомагати фахівцям із кібербезпеки розбирати складні атаки та швидше відновлювати їхню хронологію.
Результати Anthropic показують, що питання безпеки відкритих ШІ-моделей поступово виходить за межі теоретичних дискусій. GLM-5.3 поки не зрівнялася з найсучаснішими закритими системами за кіберможливостями. Проте вона вже демонструє здатність виконувати складні завдання, пов’язані з пошуком і експлуатацією вразливостей, а її ваги доступні для завантаження.
Для розробників і фахівців із кібербезпеки це означає, що відкриті моделі дедалі частіше потрібно розглядати не лише як інструменти для програмування чи генерації тексту, а й як потенційно потужні інструменти автоматизації наступальних та оборонних операцій у кіберпросторі.
8



