технический перевод

Контекстные состязательные атаки на ИИ-генераторы кода: анализ уязвимостей и последствия

Veai не доверяет генерации без проверки: проверяет ИИ-код запуском и анализом в JetBrains IDE.

Перевод аннотации

О чём статья

Системы генерации кода на основе ИИ преобразили разработку ПО, но привносят критические уязвимости безопасности на этапе вывода (inference-time). Это исследование представляет систематический анализ контекстных состязательных атак, при которых специально сконструированный контекстный ввод - комментарии, документация, имена переменных - смещает большие языковые модели в сторону генерации эксплуатируемого кода.

В 2 800 контролируемых экспериментах на CodeT5+, CodeLlama, GPT-3.5-Turbo и GPT-4 авторы количественно оценивают эффективность атак и механизмы защиты. Результаты показывают, что состязательные условия повышают генерацию уязвимого кода в 10,7 раза (с 3,5% до 37,4%), причём атаки с прямыми инструкциями достигают 100% успеха на GPT-3.5-Turbo. Переносимость между моделями достигает 60-100%, что указывает на системные архитектурные уязвимости, а не на дефекты конкретных моделей.

Предложенный двухуровневый защитный фреймворк достигает 89,1% детекции при 0,3% ложных срабатываний и задержке 520 мс, демонстрируя практическую применимость для развёртывания в реальном времени в средах разработки.

Экспертное мнение
Вывод для Veai - не доверять генерации без проверки: агент должен проверять результат через сборку, тесты, статический анализ и реальные зависимости проекта в JetBrains IDE

Перевод подготовлен технической командой Veai.