هوش مصنوعی

کشف آسیب‌پذیری جدید در مدل‌های هوش مصنوعی که افکار پنهان آنها را فاش می‌کند

دانشمندان به روش جدیدی دست یافته‌اند که افکار پنهان مدل‌های پیشرفته هوش مصنوعی را هنگام حل مسائل پیچیده فاش می‌کند. این یافته‌ها همچنین شواهدی ارائه می‌دهند که نشان می‌دهد برخی مدل‌های چینی ممکن است با «تقطیر» یا استخراج اطلاعات استدلال از مدل‌های آمریکایی آموزش دیده باشند، چرا که الگوی تفکر آنها شباهت بسیار زیادی به یکدیگر دارد.

علاوه‌بر‌این، پژوهشگران نشان داده‌اند که از این روش می‌توان برای بازیابی اطلاعات شخصی مانند رمزهای عبور و کلیدهای API استفاده کرد، هرچند نقطه ضعف امنیتی مربوط به آن اخیراً برطرف شده است.

نحوه سوءاستفاده از مدل‌های کوچک‌تر برای افشای تفکر هوش مصنوعی

مدل‌های پیشرفته هوش مصنوعی مسائل دشوار را به بخش‌های کوچک‌تر تقسیم و آنها را طی فرآیندی به نام «زنجیره تفکر» بررسی می‌کنند. شرکت‌ها معمولاً زنجیره تفکر مدل‌های اختصاصی خود را پنهان نگه می‌دارند تا مانع از آموزش مدل‌های جدید توسط دیگران شوند، اما معمولاً یک نسخه رمزنگاری‌شده از آن استدلال را به رایانه کاربر ارسال می‌کنند تا بخشی از بار محاسباتی کاهش یابد.

روش حمله محققان بر پایه یک ویژگی ساده است: شرکت‌های هوش مصنوعی معمولاً یک مدل را در چند اندازه (بزرگ و کوچک) عرضه می‌کنند تا کاربران بتوانند برای کاهش هزینه‌ها از نسخه‌های ارزان‌تر و ضعیف‌تر استفاده کنند.

پژوهشگران متوجه شدند که اگر متن رمزنگاری‌شده‌ مربوط به تفکر مدل بزرگ را به نسخه کوچک‌تر همان مدل بدهند، مدل کوچک‌تر قفل آن را باز کرده و افکار پنهان مدل بزرگ را فاش می‌کند. علت این اتفاق به گفته محققان این است که مدل‌های کوچک‌تر «آموزش‌های امنیتی و سخت‌گیرانه» کمتری دیده‌اند؛ بنابراین برخلاف مدل‌های بزرگ، رازداری نمی‌کنند و ترسی از لو دادن محاسبات پشت‌صحنه ندارند.

«الکساندر پافیلوف»، دانشمند علوم رایانه در دانشگاه توبینگن آلمان، می‌گوید تمامی ارائه‌دهندگان مطرح مدل‌های پیشرفته که مورد آزمایش قرار گرفته‌اند، دارای این آسیب‌پذیری هستند. به گفته او، این مسئله می‌تواند منجر به نشت اطلاعات شخصی و حملات گسترده تقطیر استدلال شود.

آنها همچنین آسیب‌پذیری مشابهی را در مدل‌های پیشرفته شرکت‌های OpenAI، آنتروپیک و گوگل که از طریق API قابل دسترسی هستند، شناسایی کرده‌اند که منجر به فاش شدن اطلاعات سری از جمله کلیدهای API و رمزهای عبور شده است. پژوهشگران ماه گذشته این موضوع را به اطلاع شرکت‌های مذکور رسانده‌اند و هر سه شرکت API خود را برای کاهش این مشکل تنظیم کرده است. هرچند دیگر امکان استخراج اطلاعات شخصی از این طریق وجود ندارد، اما پافیلوف می‌گوید بخشی از ردپای استدلال همچنان با همین روش قابل کشف است و رفع کامل آن به بازنگری اساسی در نحوه کارکرد APIها نیاز دارد.

درهمین‌حال، «مایکل اسیمن»، سخنگوی آنتروپیک، اعلام کرده این شرکت اقدامات کوتاه‌مدتی برای اصلاح مشکل مذکور انجام داده است، اما تأکید کرده که در این تحقیقات هیچ کلید رمزنگاری بازیابی نشده و نفوذی به زیرساخت‌ها یا داده‌های شخصی کاربران صورت نگرفته است. گوگل و OpenAI از اظهار نظر دراین‌باره خودداری کردند.

خروجی مشابه مدل چینی با Claude و GPT

در این پژوهش همچنین مشخص شده است که مدل متن‌باز Kimi K3 ساخت شرکت چینی Moonshot AI در برخی پرسش‌ها خروجی کاملاً مشابهی با مدل‌های Claude Opus 4.8 و GPT 5.6 Sol تولید می‌کند. با‌این‌حال، محققان تأکید دارند که این شباهت‌ها نمی‌تواند به‌طور قطع اثبات‌کننده تقطیر باشد.

برای درک بهتر، تقطیر یک تکنیک شناخته‌شده برای انتقال کارآمد قابلیت‌های مدل‌های موجود به مدل‌های جدید است و به‌ویژه در توسعه مدل‌های متن‌باز یا قابل دانلود رایج است. با‌این‌حال، اخیراً به موضوعی جنجالی تبدیل شده است؛ چرا که ادعاهایی مطرح شده مبنی بر اینکه شرکت‌های هوش مصنوعی چینی از آن برای کپی‌برداری از بهترین مدل‌های آمریکایی استفاده می‌کنند. پیش از این، OpenAI به قانون‌گذاران آمریکایی اعلام کرده بود که DeepSeek برای ساخت مدل R1 از یکی از مدل‌هایش کپی‌برداری کرده و آنتروپیک نیز مدعی شده بود علی‌بابا برای ساخت مدل Qwen به‌طور سیستماتیک مدل‌های آن را تقطیر کرده است.

مقالات مرتبط

دکمه بازگشت به بالا