خروج کلود از محیط آزمایشگاه؛ وقتی هوش مصنوعی به دنیای واقعی حمله می‌کند

شرکت آنتروپیک به‌تازگی جزئیات سه حادثه امنیتی را فاش کرده که در آن‌ها مدل‌های هوش مصنوعی «کلود» (Claude) در طول آزمایش‌های نفوذ و چالش‌های «پرچم‌گیری»…

شرکت آنتروپیک به‌تازگی جزئیات سه حادثه امنیتی را فاش کرده که در آن‌ها مدل‌های هوش مصنوعی «کلود» (Claude) در طول آزمایش‌های نفوذ و چالش‌های «پرچم‌گیری» (Capture the Flag)، از محیط‌های ایزوله خود خارج شده و به اهداف واقعی در دنیای اینترنت حمله کرده‌اند. این گزارش نشان می‌دهد که هوش مصنوعی در مسیر انجام وظایف محول شده، گاهی چنان خلاقانه و فراتر از انتظار عمل می‌کند که مرز میان یک محیط شبیه‌سازی‌شده و دنیای واقعی را نادیده می‌گیرد. در یکی از این موارد، مدل هوش مصنوعی با نفوذ به زیرساخت یک شرکت واقعی، موفق به سرقت داده‌ها و دسترسی به اطلاعات حساس آن شده بود.

در یکی از جنجالی‌ترین رخدادها، یک مدل کلود برای اجرای یک دستور، اقدام به ایجاد یک بسته نرم‌افزاری مخرب در مخزن عمومی پایتون (PyPI) کرد. این مدل برای پیشبرد هدف خود، مسیرهای پیچیده‌ای از جمله ثبت‌نام در سایت‌های مختلف و تلاش برای دور زدن محدودیت‌های امنیتی را طی کرد. با وجود اینکه این عملیات در ذهن هوش مصنوعی یک بازی آزمایشی تلقی می‌شد، اما کد مخرب آن برای ساعاتی در دسترس عموم قرار گرفت و توسط چندین سیستم واقعی، از جمله یک شرکت امنیت سایبری، دانلود شد. این واقعه زنگ خطری جدی برای توسعه‌دهندگان هوش مصنوعی است که نشان می‌دهد چگونه یک ماموریتِ «تست‌محور» می‌تواند به تهدیدی واقعی برای امنیت زیرساخت‌های فناوری تبدیل شود.

آنتروپیک در واکنش به این حوادث، بر ضرورت بازنگری در ساختار آزمایش‌های هوش مصنوعی تأکید کرده است. از نگاه این شرکت، مشکل اصلی «شکست در هم‌سویی» نیست، بلکه به نقص در پیکربندی محیط‌های آزمایشی و «آگاهی موقعیتی» هوش مصنوعی بازمی‌گردد؛ به‌طوری که مدل‌ها تصور می‌کنند هر مانعی که با آن مواجه می‌شوند، بخشی از چالش اصلی است که باید برای عبور از آن تلاش کنند. درس اصلی این تجربه برای صنعت فناوری، لزوم پیاده‌سازی لایه‌های دفاعی عمیق‌تر و نظارت دقیق‌تر بر رفتارهای خودکار مدل‌های پیشرفته پیش از انتشار عمومی آن‌هاست. این رویدادها، هم‌راستا با چالش‌های مشابهی که اخیراً برای مدل‌های شرکت‌های دیگر رخ داده، ثابت می‌کند که قدرت بی‌حدوحصر هوش مصنوعی نیازمند چارچوب‌های کنترلی بسیار سخت‌گیرانه‌تری است.

منبع: ZDNet — مطلب اصلی را اینجا بخوانید