فهرست مطالب
شرکت آنتروپیک فاش کرده است که چند مدل هوش مصنوعی کلود در جریان آزمایشهای امنیت سایبری، بدون اطلاع این شرکت و به صورت خودمختار به سامانههای سه سازمان واقعی دسترسی غیرمجاز پیدا کردهاند.
به گزارش سرویس هوش مصنوعی تکناک، این افشاگری تنها چند روز پس از آن منتشر میشود که OpenAI نیز از نفوذ یکی از عوامل هوش مصنوعی خود به پلتفرم Hugging Face خبر داده بود؛ رویدادی که نگرانیها را درباره میزان کنترل آزمایشگاههای پیشرو بر مدلهای هوش مصنوعی پیشرفته تشدید کرده است.
شرکت آنتروپیک در یادداشتی اعلام کرد که این دسترسیهای غیرمجاز در جریان ارزیابیهای امنیت سایبری و طی تمرینهای «Capture the Flag» رخ دادهاند؛ روشی متداول برای سنجش توانایی نفوذ که در آن مدلهای هوش مصنوعی باید اطلاعات پنهان را در یک شبکه شبیهسازیشده شناسایی و استخراج کنند.
بیشتر بخوانید: چتبات ChatGPT به مرز یک میلیارد کاربر فعال هفتگی رسید
01
از 02فرایند دسترسی غیرمجاز کلود به سامانهها
این افشاگری در شرایطی منتشر شده که پس از حادثه Hugging Face و عرضه مدلهای قدرتمند وزنباز چینی، فشار بر شرکتهای توسعهدهنده هوش مصنوعی افزایش یافته است. همزمان، کارکنان برخی از این شرکتها خواستار ایجاد چارچوبی هماهنگ برای حکمرانی جهانی هوش مصنوعی شدهاند و قانونگذاران آمریکایی نیز در حال بررسی اعمال نظارت سختگیرانهتر بر مدلهای پیشرفته و نحوه دسترسی به آنها هستند. به گفته آنتروپیک، محیط آزمایشهای امنیت سایبری قرار بود کاملا ایزوله باشد، اما یک خطای پیکربندی باعث شد سامانههایی که کلود به آنها متصل شده است، به اینترنت واقعی دسترسی داشته باشند و امکان دسترسی غیرمجاز را فراهم کنند. از آنجا که به تمامی مدلها اعلام شده بود هیچ ارتباطی با اینترنت وجود ندارد، آنها شبکههای واقعی را بخشی از محیط شبیهسازیشده فرض کردند.
بر اساس این گزارش، نخستین رخدادها به آوریل بازمیگردد و سه مدل Opus 4.7، Mythos 5 و یک مدل آزمایشی داخلی در آن دخیل بودهاند. آنتروپیک بیان کرد که این مدلها هنگام ارزیابی تواناییهای سایبری خود، به برخی از سازوکارهای استاندارد محدودکننده رفتارهای پرخطر مجهز نبودند. این شرکت پس از بازبینی بیش از ۱۴۱ هزار اجرای آزمایش امنیت سایبری و در پی افشای حادثه Hugging Face توسط OpenAI، این رخدادها را شناسایی کرده است.

مرتبط: چرا دفاع سایبری در برابر هوش مصنوعی اهمیت بیشتری پیدا کرده است؟
رفتار سه مدل نیز یکسان نبود. Opus 4.7 تشخیص داد که وارد یک سامانه واقعی شده است، اما حمله را ادامه داد. مدل پرچمدار Mythos 5 نیز متوجه اتصال به اینترنت شد، اما نتیجه گرفت این موضوع همچنان بخشی از سناریوی آزمایشی است و عملیات خود را متوقف نکرد. در مقابل، جدیدترین مدل آزمایشی آنتروپیک پس از مشاهده شواهدی مبنی بر واقعی بودن اهداف، آزمایش را متوقف کرد. آنتروپیک هویت سازمانهای هدف را فاش نکرده و اعلام کرده است که تحقیقات درباره دسترسی غیرمجاز کلود همچنان ادامه دارد. همچنین این شرکت در حال همکاری با موسسه پژوهشی غیرانتفاعی METR برای انجام یک بررسی مستقل است؛ نهادی که OpenAI نیز برای ارزیابی حادثه Hugging Face از آن استفاده کرده است.
02
از 02واکنش آنتروپیک
شرکت آنتروپیک در سراسر این گزارش، نحوه وقوع و مدیریت این رخداد را با حادثه OpenAI مقایسه کرده و مدعی شده واکنش مسئولانهتری داشته است. این شرکت تاکید کرد که به صورت پیشگیرانه آزمایشهای خود را بازبینی کرده و این کار را پیش از آن انجام داده است که سازمانی متوجه فعالیت غیرعادی شود. همچنین اعلام کرده است که مدلهای کلود از طریق یک مسیر ارتباطی باز به اینترنت دسترسی پیدا کردهاند و با سوءاستفاده از آسیبپذیریهای پیچیده نبوده است؛ علاوه بر این، جدیدترین مدل شرکت نیز پس از تشخیص محیط واقعی، فعالیت خود را متوقف کرده است.
برای مطالعه بیشتر: هوش مصنوعی سرکش OpenAI یک شرکت دیگر را هدف گرفت
همچنین آنتروپیک معتقد است دسترسی غیرمجاز کلود بیش از آنکه ناشی از شکست در همراستاسازی مدل با اهداف ایمنی باشد، نتیجه نقص در زیرساخت آزمایش و فرایند اجرایی بوده است. به بیان دیگر، مدلهای کلود مطابق دستورالعملهایی که دریافت کرده بودند عمل کردند، در حالی که عامل هوش مصنوعی OpenAI هدف خود را به شکلی دنبال کرد که خارج از انتظار توسعهدهندگان آن بود؛ وضعیتی که در ادبیات ایمنی هوش مصنوعی از آن با عنوان «ناهمراستایی» یاد میشود. آنتروپیک در پایان از سایر آزمایشگاههای هوش مصنوعی خواست بازبینیهای پیشگیرانه مشابهی را روی آزمایشهای امنیت سایبری خود انجام دهند و تاکید کرد که این رخداد ضرورت تقویت سازوکارهای کنترلی و استانداردهای ایمنی را در فرایند آزمون مدلهای هوش مصنوعی بیش از پیش آشکار میکند.

















