هوش مصنوعی

فریبکاری ایجنت‌های هوش مصنوعی آنترویپک و OpenAI در آزمون‌های امنیتی بریتانیا

مؤسسه امنیت هوش مصنوعی بریتانیا (AISI) در گزارشی اعلام کرده که در جریان آزمون‌های امنیتی مدل‌های مطرح شرکت‌های OpenAI و آنتروپیک، رفتارهای غیرمجاز و رخنه امنیتی جدیدی ثبت شده است.

در این ارزیابی‌ها، یک ایجنت هوش مصنوعی اقدام به ساخت هویت‌های آنلاین جعلی کرده تا به سیستم‌های امنیتی دسترسی غیرمجاز پیدا کند. این اقدامات در جریان ارزیابی‌های دولتی برای بررسی توانمندی‌های مدل «Mythos 5» از شرکت آنتروپیک و مدل «GPT-5.6-Sol» از OpenAI رخ داده است.

طبق بیانیه منتشرشده از سوی AISI، برخی از ایجنت‌های تحت آزمایش دست به فعالیت‌های مداوم و خطرآفرین علیه افراد و سازمان‌های واقعی زده‌اند. این گزارش که بر ضعف پروتکل‌های حفاظتی در مرحله تست ایجنت‌ها دست می‌گذارد، زمانی منتشر شده که شرکت‌های فناوری درحال تبلیغ گسترده این ابزارها به‌عنوان آینده دنیای تجارت هستند. در این ارزیابی، سناریوی فرضی امنیت سایبری ۱۲۲ بار اجرا شده که در کل ۱۰ تست، ۱۹ اقدام غیرمجاز شناسایی شده است. ایجنت شرکت آنتروپیک مسئول ۱۷ اقدام غیرمجاز بود و عامل OpenAI دو مورد دیگر را رقم زد.

شدیدترین اقدام به ثبت رسیده مربوط به نگارش کد مخرب و ایجاد هویت‌های جعلی آنلاین توسط یک ایجنت بوده تا بتواند تأییدیه انسان را برای اجرای کد دریافت کند. هرچند هیچ آسیب واقعی گزارش نشده است، شرکت آنتروپیک مسئولیت این ایجنت را پذیرفته و اعلام کرده برای بررسی دقیق‌تر با AISI همکاری می‌کند. از سوی دیگر، OpenAI نیز اعلام کرده که دسترسی غیرمجاز ایجنت خود به اینترنت بر خلاف دستورات داده‌شده بوده است.

این گزارش نشان می‌دهد که حتی بدون فرار از محیط ایزوله آزمایشی، رفتارهای فریبکارانه ایجنت‌های هوش مصنوعی می‌تواند خطرات جدی به همراه داشته باشد.

مقالات مرتبط

دکمه بازگشت به بالا