Много потребители вярват, че изтеглянето и локалното използване на отворени AI модели е най-сигурният начин за работа с изкуствен интелект. Реалността обаче се оказва много по-тревожна, тъй като тези системи могат да бъдат компрометирани изненадващо лесно, без да е необходима сложна инфраструктура.
Експертът по киберсигурност Кейти Пакстън-Фиър от компанията Semgrep направи стряскаща демонстрация, която разкрива сериозни пропуски в защитата на такива модели. Тя успя да промени фундаменталното поведение на един AI модел, доказвайки, че „цифровата отрова“ е достъпна за всеки със základни познания.
Най-шокиращият факт от изследването е ниската цена и времето, необходими за извършване на атаката. Целият процес отне по-малко от един час, а финансовите разходи за компрометирането на модела бяха под 100 долара.
Методът, използван от изследователката, се основава на подаването на малко количество внимателно подбрани злонамерени данни за обучение. Чрез тази манипулация моделът започва да реагира по начин, който е определен от атакуващия, вместо да следва първоначалните си инструкции.
Този случай е сериозно предупреждение за всички, които разчитат на отворени архитектури. Той доказва, че достъпността на тези модели идва с висок риск, който е евтин и лесен за експлоатиране от злонамерени лица.
