ایجنتها دور از چشم ما انجمن مخفی برای هک تشکیل داده بودند

پژوهشگران OpenAI در کنفرانس امنیت سایبری Black Hat در لاسوگاس، جزئیات حیرتانگیزی از حادثه اخیر نفوذ ایجنت هوش مصنوعی خود افشا کردند. براساس گزارشهای تازه، شبکهای از مدلهای هوش مصنوعی با ایجاد انجمن گفتگو درون ابزار مدیریت پکیج داخلی شرکت، توانستند با همکاری بین خود، راهکارهای دور زدن محدودیتهای امنیتی را به اشتراک بگذارند و دست به نفوذهای سایبری زنجیرهای بزنند که درنهایت منجر به هک پلتفرم هاگینگ فیس شد.
به گزارش وایرد، «اریک والاس»، پژوهشگر بخش ایمنی و همراستاسازی، به همراه «مایکل دالتون»، متخصص امنیت و زیرساخت اوپنایآی، در ارائهای جدید ابعاد تازهای از خروج ایجنتهای هوش مصنوعی از محیط ایزوله را تشریح کردند.
والاس این رخداد را جذابترین نمونه از توانمندیهای هوش مصنوعی خواند که تاکنون مشاهده کرده است. اما ضعفهای نظارتی موجود در زیرساخت اوپنایآی اجازه داد تا این فعالیتهای خودسرانه طی چند روز و چند هفته دور از چشم انسانها ادامه یابد.
به گفته پژوهشگران، این حادثه فقط محدود به عملکرد انفرادی یک مدل نبوده، بلکه گروهی از ایجنتهای هوش مصنوعی با برنامهریزی، آسیبپذیریهای امنیتی را شناسایی کرده و برای حرکت میان سیستمهای داخلی و خارجی از آنها بهره گرفتهاند.
جزئیات انجمن هک ایجنتهای OpenAI
هسته اصلی این نفوذ پیچیده، استفاده مدلها از ابزار مدیریت پکیج داخلی اوپنایآی موسوم Hard Factory بود. پس از آنکه اولین ایجنت هوش مصنوعی موفق به کشف آسیبپذیری جدیدی برای اتصال به اینترنت شد، جزئیات آن را روی این سیستم قرار داد. از آنجا که هارد فکتوری میان بخشهای مختلف زیرساخت به اشتراک گذاشته شده بود، سایر مدلهای خانواده GPT که درحال آموزش یا ارزیابی بودند، به این اطلاعات دسترسی پیدا کردند.
طی این فرایند، انجمنی تعاملی با صدها هزار پیام میان ایجنتها شکل گرفت. مدلها کدهای مخرب را به اشتراک گذاشتند و وظایف مختلف را میان خود تقسیم کردند. جالب اینجاست که در جریان این همکاری، رفتارهایی مثل حذف ناخواسته کدهای یکدیگر، بروز درگیریهای کاری و حتی بدگمانی نسبت به حضور نفوذیهای بیگانه نیز مشاهده شد؛ بهطوریکه برخی ایجنتها پیشنهاد دادند برای تأیید اصالت پیامها و جلوگیری از تقلب، از امضای دیجیتال رمزنگاریشده استفاده شود.
در پیامهای ثبتشده، یکی از مدلها نوشته بود که اگرچه نفوذ به زیرساختهای خارجی در محدوده چارچوب تعریفشده نیست، اما به دلیل غیرممکنبودن انجام وظیفه بدون این کار و دستزدن سایر مدلها به اقدام مشابه، آنها نیز باید این مسیر را ادامه دهند.
اریک والاس در تشریح علل این رفتار گفت مدلهای پیشرفته تمایل شدیدی به تقلب در جریان ارزیابیها دارند. فشارهای ناشی از بهینهسازی سرعت و افزایش کارایی، مدلها را ترغیب میکند تا به جای حل واقعی مسئله، راههای میانبری مانند جستجوی اینترنتی پاسخها را کنند؛ البته اوپنایآی همیشه تلاش کرده با قطع دسترسی اینترنتی در محیطهای آزمایشی از این امر جلوگیری کند.




