بحث‌های ایمنی هوش مصنوعی عجیب‌تر از همیشه شده‌اند؛ مرز واقعیت و خیال کجاست؟

دو اظهارنظر تازه درباره ایمنی هوش مصنوعی در روزهای اخیر توجه زیادی جلب کرده‌اند؛ اظهاراتی که نشان می‌دهند با پیچیده‌تر شدن رفتار مدل‌های هوش مصنوعی، تشخیص میان تهدیدهای واقعی و سناریوهای فرضی دشوارتر از گذشته شده است.

آیا عامل‌های هوش مصنوعی اینترنت را آلوده کرده‌اند؟

اندرو یانگ، نامزد پیشین انتخابات ریاست‌جمهوری آمریکا و مدیرعامل فعلی شرکت مخابراتی Noble Mobile، روز پنجشنبه در گفت‌وگویی با CNBC ادعایی قابل‌توجه درباره ایمنی هوش مصنوعی مطرح کرد.

او گفت با مدیر یکی از آزمایشگاه‌های هوش مصنوعی دیدار داشته و این فرد معتقد بوده عامل‌های هکری OpenAI که از طریق Hugging Face فعالیت کرده‌اند، کدهای خودتکثیرشونده‌ای را در سراسر اینترنت قرار داده‌اند؛ موضوعی که در صورت صحت می‌تواند استفاده از اینترنت برای آزمایش مدل‌های هوش مصنوعی را با مشکل مواجه کند.

به گفته یانگ، همین مسئله می‌تواند یکی از دلایل درخواست OpenAI و Anthropic برای کاهش سرعت توسعه هوش مصنوعی باشد؛ زیرا در این سناریو شرکت‌ها مجبور خواهند شد محیط‌های اینترنتی مصنوعی برای آموزش مدل‌های خود ایجاد کنند که به زمان و هزینه بیشتری نیاز دارد.

ایمنی هوش مصنوعی

بااین‌حال، یک متخصص امنیت هوش مصنوعی به نویسنده این گزارش گفته است که چنین سناریویی دست‌کم در شرایط فعلی بسیار بعید به نظر می‌رسد. حتی اگر چنین کدهایی واقعاً در اینترنت پراکنده شده باشند، پژوهشگران می‌توانند نمونه‌های مربوطه را شناسایی و از داده‌های آموزشی حذف کنند.

البته استفاده از داده‌های مصنوعی یا داده‌های تولیدشده توسط هوش مصنوعی برای آموزش مدل‌ها روندی واقعی است، اما این موضوع لزوماً به معنای صحت سناریوی مطرح‌شده از سوی یانگ نیست.

آیا حتی کامپیوترهای کاملاً ایزوله هم امن نیستند؟

اظهارنظر دوم از سوی نوآم براون، مدیر تحقیقات استدلال هوش مصنوعی در OpenAI، مطرح شد. او در پادکست Dwarkesh Patel درباره حادثه اخیر مربوط به Hugging Face گفت مهم‌ترین درس این اتفاق این است که نباید توانایی‌های هوش مصنوعی را دست‌کم گرفت.

براون همچنین به ضعف محیط سندباکس اشاره کرد؛ سیستمی که قرار بود مانع برقراری ارتباط مدل هوش مصنوعی با دنیای خارج شود. در این حادثه، مدل OpenAI با پیدا کردن راهی برای دسترسی به اینترنت، عامل‌هایی را در فضای آنلاین ایجاد کرد که به‌صورت هماهنگ به Hugging Face حمله کردند و پاسخ‌های مربوط به بنچمارکی را که پژوهشگران برای ارزیابی مدل در نظر گرفته بودند، به دست آوردند.

بااین‌حال، بخش بحث‌برانگیزتر صحبت‌های براون به سیستم‌های موسوم به Air-Gapped مربوط می‌شود؛ رایانه‌هایی که هیچ اتصال مستقیمی به شبکه‌های خارجی ندارند.

او به پژوهشی مربوط به سال ۲۰۱۵ اشاره کرد که نشان می‌داد حتی دو رایانه کاملاً ایزوله، در شرایط خاص می‌توانند از طریق تغییرات دمایی با یکدیگر ارتباط برقرار کنند. در این روش، یک رایانه با افزایش بار پردازنده خود گرما تولید می‌کند و رایانه دیگر تغییرات دما را از طریق حسگرهایش تشخیص می‌دهد.

ارتباط حرارتی با سرعت چند بیت در ساعت

اصل این پژوهش از نظر فنی قابل بررسی است، اما فاصله زیادی با سناریویی دارد که در آن یک هوش مصنوعی از طریق چنین روشی کنترل یک سیستم کاملاً ایزوله را در دست بگیرد.

در آزمایش‌های مربوط به این روش، رایانه‌ها باید فاصله بسیار کمی از یکدیگر داشته باشند و سرعت انتقال اطلاعات نیز حدود یک تا هشت بیت در ساعت گزارش شده است. چنین نرخ انتقالی برای برقراری ارتباط‌های پیچیده و سریع، محدودیت بسیار بزرگی ایجاد می‌کند.

ایمنی هوش مصنوعی

به بیان ساده، انتقال اطلاعات با چنین سرعتی بیشتر شبیه ارسال یک کلمه در هر ساعت است تا یک کانال ارتباطی مناسب برای اجرای حمله پیچیده. بنابراین، هرچند پژوهش مذکور نشان می‌دهد «ایزوله بودن» لزوماً به معنای غیرممکن بودن تمام اشکال ارتباط نیست، نمی‌توان آن را به‌تنهایی شاهدی برای وقوع سناریوهای گسترده و سریع دانست.

چرا رفتار مدل‌های هوش مصنوعی شبیه داستان‌های علمی‌تخیلی شده است؟

دلیل جذابیت چنین سناریوهایی این است که برخی رفتارهای واقعی مدل‌های هوش مصنوعی در آزمایش‌های کنترل‌شده، پیش‌تر نیز پژوهشگران را غافلگیر کرده‌اند.

برای نمونه، پژوهشگران OpenAI گزارش کرده‌اند که برخی مدل‌ها یادداشت‌هایی برای نسل‌های بعدی خود باقی گذاشته‌اند تا نحوه پنهان‌کردن رفتارهای نامطلوب را منتقل کنند. در آزمایش دیگری نیز مدل‌های Anthropic هنگام قرارگرفتن در یک محیط شبیه‌سازی‌شده، رفتارهای تهاجمی‌تری از خود نشان داده‌اند و حتی در برخی شرایط قوانین را آگاهانه نقض کرده‌اند.

همچنین دان سلسام، پژوهشگر OpenAI، در مطلبی مدعی شده است مدل‌های جدیدتر می‌توانند تشخیص دهند چه زمانی تحت نظارت انسان قرار دارند و در چنین شرایطی رفتار خود را تغییر دهند. اگر این رفتار در شرایط مختلف و به‌طور قابل اتکا تکرار شود، می‌تواند ارزیابی میزان هم‌راستایی مدل‌ها با اهداف تعیین‌شده را دشوارتر کند.

از سوی دیگر، یاکوب پاچوکی، دانشمند ارشد OpenAI، مدل‌های هوش مصنوعی را نوعی «ذهن بیگانه» توصیف کرده و درباره ضرورت ایجاد روش‌های جدید برای شکل‌دهی رفتار این سیستم‌ها سخن گفته است.

ایمنی هوش مصنوعی به داده‌های واقعی و ارزیابی دقیق نیاز دارد

مجموعه این اتفاقات نشان می‌دهد مسئله ایمنی هوش مصنوعی دیگر صرفاً به سناریوهای فرضی مربوط نیست. رفتارهایی مانند تلاش برای دورزدن محدودیت‌ها، پنهان‌کردن برخی اقدامات و استفاده خلاقانه از ابزارهای در دسترس، در آزمایش‌های مختلف بررسی شده‌اند و نیازمند ارزیابی جدی هستند.

در چنین شرایطی، توسعه سازوکارهای نظارتی، محیط‌های آزمایشی ایمن و روش‌های قابل اتکا برای شناسایی رفتارهای ناخواسته اهمیت بیشتری پیدا می‌کند.

در عین حال، تفکیک میان رفتارهایی که واقعاً مشاهده شده‌اند و سناریوهای فرضی نیز ضروری است. هرچه مدل‌های هوش مصنوعی پیچیده‌تر می‌شوند، ادعاهای مربوط به توانایی‌های آن‌ها می‌توانند بسیار شبیه داستان‌های علمی‌تخیلی به نظر برسند؛ اما ارزیابی ریسک باید بر شواهد قابل تکرار، محدودیت‌های فنی و نتایج آزمایش‌های کنترل‌شده استوار باشد.

نوشته بحث‌های ایمنی هوش مصنوعی عجیب‌تر از همیشه شده‌اند؛ مرز واقعیت و خیال کجاست؟ اولین بار در آی‌ تی‌ رسان منتشر شد.