فهرست مطالب
شرکتهای چینی نظیر علیبابا با ارسال میلیونها درخواست مشکوک توانستند فرایندهای فکری مدل Claude را برای ارتقای مدلهای بومی خود مهندسی معکوس کنند.
به گزارش سرویس اخبار هوش مصنوعی تکناک، شرکت آنتروپیک با انتشار گزارشی اعلام کرد آزمایشگاهها و شرکتهای چینی با انجام ۲۰۰ میلیون تبادل داده، حملات سازمانیافتهای را برای استخراج فرایند تفکر مدلهای پیشرفته Claude و آموزش مدلهای بومی خود اجرا کردهاند.
حملات موسوم به distillation در ماههای اخیر و همزمان با رقابت فزاینده در حوزه هوش مصنوعی شدت گرفتهاند. هدف اصلی این حملات، مهندسی معکوس و استخراج دادههای استدلالی یا همان chain of thought از مدلهای پیشرو آمریکایی است تا از این اطلاعات برای آموزش مدلهای کوچکتر از طریق fine-tuning استفاده شود. در این میان، قابلیتهای حیاتی مدل Claude مانند انجام وظایف خودکار با عاملهای هوشمند، ابزارنویسی، تحلیل داده و کدنویسی هدف اصلی مهاجمان بودهاند.
مرتبط: هوش مصنوعی ۴۰ میلیون خط کد لینوکس را زیر ذرهبین برد
شیوههای دور زدن لایههای امنیتی آنتروپیک
مدلهای مدرن معمولاً فرایند تفکر داخلی خود را مخفی نگه میدارند و تنها خلاصهای کلی از محاسبات ذهنی را به کاربران نشان میدهند. با وجود این لایههای امنیتی، مهاجمان روشهای خلاقانهای برای دور زدن محدودیتها ابداع کردهاند. برای نمونه، در یک شیوه حمله، از سیستم خواسته شده تا حافظه موقت و استدلالهای درونی مدل را در قالب ترجمه به زبان ژاپنی با خط katakana بازنویسی کند، ترفندی که سیستم محافظتی را فریب داده و باعث افشای ساختار منطقی پاسخ شده است.

بررسی این کمپینها نشان میدهد که عمده این فعالیتها از سوی Alibaba هدایت شده است. بین ماههای مه و ژوئیه ۲۰۲۶، بالغ بر ۱۵۱ میلیون تبادل داده با اوج سه میلیون درخواست در روز ثبت شده است. این عملیات گسترده از طریق ۳۵۰۰ حساب کاربری مختلف و با استفاده از دستورهای متنی یکسان صورت گرفت تا دادههای آموزشی لازم برای توسعه و ارتقای خانواده مدلهای Qwen این شرکت چینی جمعآوری شود.
مرتبط: آیا هوش مصنوعی می تواند به آگاهی دست یابد؟
فعالیت مشکوک استارتاپ چینی Moonshot AI
طبق گزارش تککرانچ، بخش دیگری از این تهاجم سایبری به Moonshot AI، سازنده مدل Kimi، نسبت داده شده که الگوهای متفاوتی را به نمایش گذاشته است. بررسی درخواستهای ارسالشده از سوی شبکهای شامل ۵۰۰۰ حساب کاربری نشان میدهد که این گروه در بازهای ۱۰ روزه، ۳۰۰ هزار درخواست را عمدتاً به سمت مدل قدرتمند Opus هدایت کردهاند. در یکی از این موارد، از مدل خواسته شده بود رفتارهای مشکوک را در تصاویر دوربینهای نظارتی ارزیابی کند، درخواستی که ماهیت استفادههای امنیتی و نظامی را آشکار میکند.
تلاشهای مشابهی پیش از این توسط دیگر غولهای هوش مصنوعی مانند OpenAI علیه شرکتهای چینی دیگر گزارش شده بود. با این حال، مقیاس و شدت اقدامات اخیر نشان میدهد که رقابت در عرصه مدلهای زبانی بزرگ از مرحله آموزش مستقل فراتر رفته و به فاز برداشت غیرمجاز و انتقال مستقیم دستاوردهای پردازشی تغییر مسیر داده است.

















