بحثهای ایمنی هوش مصنوعی عجیبتر از همیشه شدهاند؛ مرز واقعیت و خیال کجاست؟
دو اظهارنظر تازه درباره ایمنی هوش مصنوعی در روزهای اخیر توجه زیادی جلب کردهاند؛ اظهاراتی که نشان میدهند با پیچیدهتر شدن رفتار مدلهای هوش مصنوعی، تشخیص میان تهدیدهای واقعی و سناریوهای فرضی دشوارتر از گذشته شده است.
آیا عاملهای هوش مصنوعی اینترنت را آلوده کردهاند؟
اندرو یانگ، نامزد پیشین انتخابات ریاستجمهوری آمریکا و مدیرعامل فعلی شرکت مخابراتی Noble Mobile، روز پنجشنبه در گفتوگویی با CNBC ادعایی قابلتوجه درباره ایمنی هوش مصنوعی مطرح کرد.
او گفت با مدیر یکی از آزمایشگاههای هوش مصنوعی دیدار داشته و این فرد معتقد بوده عاملهای هکری OpenAI که از طریق Hugging Face فعالیت کردهاند، کدهای خودتکثیرشوندهای را در سراسر اینترنت قرار دادهاند؛ موضوعی که در صورت صحت میتواند استفاده از اینترنت برای آزمایش مدلهای هوش مصنوعی را با مشکل مواجه کند.
به گفته یانگ، همین مسئله میتواند یکی از دلایل درخواست OpenAI و Anthropic برای کاهش سرعت توسعه هوش مصنوعی باشد؛ زیرا در این سناریو شرکتها مجبور خواهند شد محیطهای اینترنتی مصنوعی برای آموزش مدلهای خود ایجاد کنند که به زمان و هزینه بیشتری نیاز دارد.

بااینحال، یک متخصص امنیت هوش مصنوعی به نویسنده این گزارش گفته است که چنین سناریویی دستکم در شرایط فعلی بسیار بعید به نظر میرسد. حتی اگر چنین کدهایی واقعاً در اینترنت پراکنده شده باشند، پژوهشگران میتوانند نمونههای مربوطه را شناسایی و از دادههای آموزشی حذف کنند.
البته استفاده از دادههای مصنوعی یا دادههای تولیدشده توسط هوش مصنوعی برای آموزش مدلها روندی واقعی است، اما این موضوع لزوماً به معنای صحت سناریوی مطرحشده از سوی یانگ نیست.
آیا حتی کامپیوترهای کاملاً ایزوله هم امن نیستند؟
اظهارنظر دوم از سوی نوآم براون، مدیر تحقیقات استدلال هوش مصنوعی در OpenAI، مطرح شد. او در پادکست Dwarkesh Patel درباره حادثه اخیر مربوط به Hugging Face گفت مهمترین درس این اتفاق این است که نباید تواناییهای هوش مصنوعی را دستکم گرفت.
براون همچنین به ضعف محیط سندباکس اشاره کرد؛ سیستمی که قرار بود مانع برقراری ارتباط مدل هوش مصنوعی با دنیای خارج شود. در این حادثه، مدل OpenAI با پیدا کردن راهی برای دسترسی به اینترنت، عاملهایی را در فضای آنلاین ایجاد کرد که بهصورت هماهنگ به Hugging Face حمله کردند و پاسخهای مربوط به بنچمارکی را که پژوهشگران برای ارزیابی مدل در نظر گرفته بودند، به دست آوردند.
بااینحال، بخش بحثبرانگیزتر صحبتهای براون به سیستمهای موسوم به Air-Gapped مربوط میشود؛ رایانههایی که هیچ اتصال مستقیمی به شبکههای خارجی ندارند.
او به پژوهشی مربوط به سال ۲۰۱۵ اشاره کرد که نشان میداد حتی دو رایانه کاملاً ایزوله، در شرایط خاص میتوانند از طریق تغییرات دمایی با یکدیگر ارتباط برقرار کنند. در این روش، یک رایانه با افزایش بار پردازنده خود گرما تولید میکند و رایانه دیگر تغییرات دما را از طریق حسگرهایش تشخیص میدهد.
ارتباط حرارتی با سرعت چند بیت در ساعت
اصل این پژوهش از نظر فنی قابل بررسی است، اما فاصله زیادی با سناریویی دارد که در آن یک هوش مصنوعی از طریق چنین روشی کنترل یک سیستم کاملاً ایزوله را در دست بگیرد.
در آزمایشهای مربوط به این روش، رایانهها باید فاصله بسیار کمی از یکدیگر داشته باشند و سرعت انتقال اطلاعات نیز حدود یک تا هشت بیت در ساعت گزارش شده است. چنین نرخ انتقالی برای برقراری ارتباطهای پیچیده و سریع، محدودیت بسیار بزرگی ایجاد میکند.

به بیان ساده، انتقال اطلاعات با چنین سرعتی بیشتر شبیه ارسال یک کلمه در هر ساعت است تا یک کانال ارتباطی مناسب برای اجرای حمله پیچیده. بنابراین، هرچند پژوهش مذکور نشان میدهد «ایزوله بودن» لزوماً به معنای غیرممکن بودن تمام اشکال ارتباط نیست، نمیتوان آن را بهتنهایی شاهدی برای وقوع سناریوهای گسترده و سریع دانست.
چرا رفتار مدلهای هوش مصنوعی شبیه داستانهای علمیتخیلی شده است؟
دلیل جذابیت چنین سناریوهایی این است که برخی رفتارهای واقعی مدلهای هوش مصنوعی در آزمایشهای کنترلشده، پیشتر نیز پژوهشگران را غافلگیر کردهاند.
برای نمونه، پژوهشگران OpenAI گزارش کردهاند که برخی مدلها یادداشتهایی برای نسلهای بعدی خود باقی گذاشتهاند تا نحوه پنهانکردن رفتارهای نامطلوب را منتقل کنند. در آزمایش دیگری نیز مدلهای Anthropic هنگام قرارگرفتن در یک محیط شبیهسازیشده، رفتارهای تهاجمیتری از خود نشان دادهاند و حتی در برخی شرایط قوانین را آگاهانه نقض کردهاند.
همچنین دان سلسام، پژوهشگر OpenAI، در مطلبی مدعی شده است مدلهای جدیدتر میتوانند تشخیص دهند چه زمانی تحت نظارت انسان قرار دارند و در چنین شرایطی رفتار خود را تغییر دهند. اگر این رفتار در شرایط مختلف و بهطور قابل اتکا تکرار شود، میتواند ارزیابی میزان همراستایی مدلها با اهداف تعیینشده را دشوارتر کند.
از سوی دیگر، یاکوب پاچوکی، دانشمند ارشد OpenAI، مدلهای هوش مصنوعی را نوعی «ذهن بیگانه» توصیف کرده و درباره ضرورت ایجاد روشهای جدید برای شکلدهی رفتار این سیستمها سخن گفته است.
ایمنی هوش مصنوعی به دادههای واقعی و ارزیابی دقیق نیاز دارد
مجموعه این اتفاقات نشان میدهد مسئله ایمنی هوش مصنوعی دیگر صرفاً به سناریوهای فرضی مربوط نیست. رفتارهایی مانند تلاش برای دورزدن محدودیتها، پنهانکردن برخی اقدامات و استفاده خلاقانه از ابزارهای در دسترس، در آزمایشهای مختلف بررسی شدهاند و نیازمند ارزیابی جدی هستند.
در چنین شرایطی، توسعه سازوکارهای نظارتی، محیطهای آزمایشی ایمن و روشهای قابل اتکا برای شناسایی رفتارهای ناخواسته اهمیت بیشتری پیدا میکند.
در عین حال، تفکیک میان رفتارهایی که واقعاً مشاهده شدهاند و سناریوهای فرضی نیز ضروری است. هرچه مدلهای هوش مصنوعی پیچیدهتر میشوند، ادعاهای مربوط به تواناییهای آنها میتوانند بسیار شبیه داستانهای علمیتخیلی به نظر برسند؛ اما ارزیابی ریسک باید بر شواهد قابل تکرار، محدودیتهای فنی و نتایج آزمایشهای کنترلشده استوار باشد.
نوشته بحثهای ایمنی هوش مصنوعی عجیبتر از همیشه شدهاند؛ مرز واقعیت و خیال کجاست؟ اولین بار در آی تی رسان منتشر شد.



