فهرست مطالب
شرکت شیائومی در حرکتی غافلگیرکننده، مدل MiMo-V2.6-Pro، جدیدترین نسل از خانواده مدلهای زبانی MiMo را معرفی کرد و از دیپسیک پیشی گرفت.
به گزارش سرویس هوش مصنوعی تکناک، این مدل با کسب امتیاز ۴۶ در شاخص هوش Artificial Analysis، به یکی از قدرتمندترین و بر اساس این ارزیابی، برترین مدل اوپنویت جهان تبدیل شد.
امتیاز ۴۶، پرچمدار جدید شیائومی را در روش امتیازدهی فعلی Artificial Analysis بالاتر از مدلهای اختصاصی مانند Grok 4.6 از xAI با امتیاز ۴۴ و Gemini 3.8 Flash گوگل با امتیاز ۴۱ قرار میدهد. همچنین مدل MiMo-V2.6-Pro با Grok 4.7 که همزمان معرفی شده و همین امتیاز ۴۶ را کسب کرده است، در یک سطح قرار دارد و بالاتر از مدلهای اوپنویت چینی DeepSeek V4.1 Flash با امتیاز ۳۹ و DeepSeek V4.1 Pro با امتیاز ۳۶ ایستاده است.
اهمیت این دستاورد تنها به این موضوع محدود نمیشود که شیائومی در بازار جهانی بیشتر با گوشیهای هوشمند، خودروهای برقی و محصولات الکترونیکی شناخته میشود. نکته مهمتر این است که MiMo-V2.6-Pro یک مدل اوپنویت با مجوز MIT محسوب میشود و هزینه استفاده از آن از طریق API شیائومی به شکل چشمگیری کمتر از بسیاری از مدلهای اختصاصی در همین سطح عملکرد است.
بیشتر بخوانید: تراشه جدید علیبابا معرفی شد
در نتیجه، توسعهدهندگان مستقل و شرکتها میتوانند MiMo-V2.6-Pro را به صورت رایگان از Hugging Face دریافت کنند، آن را برای کاربردهای خاص خود شخصیسازی یا تنظیم دقیق نمایند، روی سختافزار شخصی یا اجارهای اجرا کنند و در محیطهای عملیاتی خود به کار بگیرند؛ بدون آنکه برای این استفاده مستقیم، هزینهای به شیائومی بپردازند. امکان استفاده از API شیائومی نیز وجود دارد و هزینه آن در میان ارزانترین گزینهها به ازای هر میلیون توکن قرار میگیرد، هرچند برای سازمانهایی که محدودیت استفاده از سرورهای مستقر در چین دارند، این گزینه ممکن است چالشهایی ایجاد کند.
شیائومی برای هر میلیون توکن ورودی بدون کش ۰٫۴۳۵ دلار و برای هر میلیون توکن خروجی ۰٫۸۷ دلار دریافت میکند. Artificial Analysis هزینه این مدل را برای هر وظیفه در شاخص هوش ۰٫۱۳ دلار و سرعت تولید خروجی آن را حدود ۱۳۴ توکن در ثانیه برآورد کرده است. همچنین مدل MiMo-V2.6-Pro از پنجره زمینه یک میلیون توکنی و ورودیهای متنی، تصویری، صوتی و ویدیویی پشتیبانی میکند.
شیائومی در کنار مدل پرچمدار، MiMo-V2.6-Flash را نیز عرضه کرده است؛ مدلی کوچکتر و بهمراتب ارزانتر که با قیمت ۰٫۱۴ دلار برای هر میلیون توکن ورودی و ۰٫۲۸ دلار برای هر میلیون توکن خروجی، همان پنجره زمینه یک میلیون توکنی و قابلیتهای چندوجهی بومی را حفظ میکند و برای بارهای کاری تولیدی با حجم بالا هدفگذاری شده است. بر اساس ارزیابی انجامشده، این مدل از نظر هزینه استفاده از API در میان ارزانترین مدلهای بزرگ هوش مصنوعی مرزی جهان قرار دارد.
نسخه دیگری با نام MiMo-V2.6-Pro-UltraSpeed نیز معرفی شده که شیائومی مدعی است میتواند خروجی را با سرعتی تا ۲۰ برابر نسخه معمول Pro تولید کند. مجموع این محصولات نشان میدهد V2.6 یک عرضه مدل جدید نیست، بلکه مرحله دیگری از برنامه شیائومی برای ساخت یک پشته کامل هوش مصنوعی عاملمحور است؛ پشتهای که مدلهای پایه، عاملهای برنامهنویسی، چارچوبهای اجرایی، محیطهای یادگیری تقویتی و در نهایت زیرساخت آموزش مدلها را در بر میگیرد.
از گوشی تا خودروهای برقی
ورود شیائومی به حوزه مدلهای هوش مصنوعی مرزی طی سال گذشته با شتاب زیادی دنبال شده است. این شرکت توسعه عمومی خانواده MiMo را از سال ۲۰۲۵ آغاز کرد و در سال ۲۰۲۶ تمرکز خود را بیش از پیش به سمت هوش مصنوعی عاملمحور برد. عرضه MiMo-V2.5 و V2.5-Pro در آوریل، بسیاری از مولفههای معماری و اقتصادی (از مدلهای تنک ترکیبی از متخصصان و پنجره زمینه یک میلیون توکنی گرفته تا مجوزهای آزاد و قیمتگذاری بسیار پایین برای اجرای عاملهای هوش مصنوعی در فرایندهای طولانی) را پایهگذاری کرد که اکنون در V2.6 دیده میشوند.
MiMo-V2.5-Pro یک مدل ترکیبی از متخصصان با ۱٫۰۲ تریلیون پارامتر بود که تنها ۴۲ میلیارد پارامتر آن هنگام استنتاج فعال میشد. این مدل بهطور اختصاصی برای مهندسی نرمافزار در فرایندهای طولانی و قابلیتی موسوم به «آگاهی از چارچوب اجرایی» آموزش داده شده بود؛ قابلیتی که به مدل اجازه میدهد در چارچوب عاملها و طی صدها یا هزاران فراخوانی ابزار، حافظه و زمینه خود را مدیریت کند.

برای مطالعه بیشتر: اجرای Muse متا برای ۱۰۰ میلیون کاربر به ۱.۵۸ میلیون پردازنده نیاز دارد
شیائومی در ژوئن با معرفی MiMo Code (یک عامل برنامهنویسی ترمینالی متنباز با حافظه پایدار میان جلسات، نقاط بررسی وظایف و یک عامل فرعی اختصاصی برای ثبت نقاط بررسی)، گام دیگری برداشت. آزمایشهای داخلی شرکت نشان دادند مزیت MiMo Code در مقایسه با Claude Code زمانی بیشتر میشود که فرایندهای کاری از ۲۰۰ مرحله اجرایی عبور کنند، هرچند این نتایج توسط خود شیائومی گزارش شدهاند و به پیکربندی آزمایشها وابسته هستند.
همچنین شیائومی چارچوب پژوهشی HarnessX را توسعه داد که در آن دستورهای متنی، سیستمهای حافظه، ابزارها و منطق کنترلی پیرامون مدل نیز بهعنوان اجزایی قابل بازنویسی و بهینهسازی در نظر گرفته میشوند. طبق گزارش شیائومی، تکامل پویای این چارچوب بدون تغییر مدل پایه، در ۱۵ ترکیب مدل و بنچمارک مختلف بهطور میانگین ۱۴٫۵ درصد بهبود عملکرد مطلق ایجاد کرده است. MiMo-V2.6 اکنون این مسیرهای تحقیقاتی را یک گام جلوتر برده و آنها را وارد فرایند آموزش مدل کرده است.
هزینه میلیون دلاری برای مدل MiMo-V2.6
مهمترین جنبه فنی MiMo-V2.6 در یادگیری تقویتی یا RL نهفته است؛ مرحلهای که در آن مدل با اجرای مکرر وظایف، بر اساس کیفیت عملکرد خود پاداش یا جریمه دریافت میکند و سپس پارامترهای خود را به سمت رفتارهایی سوق میدهد که احتمال دستیابی به نتایج بهتر را افزایش میدهند. مقیاسدهی این فرایند پرهزینه است، زیرا وظایف عاملمحور میتوانند زنجیرههای طولانی استدلال، فراخوانی ابزار و اعتبارسنجی را شامل شوند. با وجود این، مزیت بالقوه آن قابل توجه است؛ مدل دیگر فقط از نمونههای ثابت یاد نمیگیرد، بلکه به صورت مکرر اجرای واقعی کارهای پیچیده را تمرین میکند.
شیائومی اعلام کرده است که MiMo-V2.6-Pro و MiMo-V2.6-Flash هرکدام ۳۰ مرحله بزرگ RL را طی کردهاند که در مجموع حدود ۷۵۰ هزار مسیر اجرایی را در کمتر از شش روز پوشش داده است. هزینه اعلامشده برای این فرایند حدود ۲٫۶۲ میلیون دلار برای نسخه Pro و ۸۵۰ هزار دلار برای نسخه Flash بوده است.
گزارش فنی عمومی شرکت ابعاد این فرایند را ملموستر میکند. هر مرحله آموزش با ۱۵۶۸ پرامپت آغاز میشود و برای هر پرامپت ۱۶ مسیر کاندید تولید میکند؛ یعنی حدود ۲۵ هزار اجرای آموزشی و بین ۲٫۷ تا ۳٫۷ میلیارد توکن آموزشی در هر مرحله است. شیائومی بیان کرده است که طول متوسط این توالیها به حدود ۱۱۰ هزار تا ۱۵۰ هزار توکن میرسد. بنابراین، تمرکز شیائومی بر تقویت پاسخهای کوتاه نبوده، بلکه کل گردشکارهای طولانی عاملها را تحت یادگیری تقویتی قرار داده است.
در این میان، تنها بخشی از هزینه صرف بهروزرسانی خود مدل شده است. طبق گزارش شیائومی، ۴۳٫۵ درصد از هزینه RL مدل Pro به آموزش، ۴۳٫۸ درصد به تولید مسیرهای اجرایی و ۱۲٫۷ درصد به امتیازدهی آنها اختصاص یافته است. به بیان دیگر، بیش از نیمی از بودجه صرف تولید و ارزیابی تجربههای مدل شده است؛ تجربههایی که به بهروزرسانی وزنهای مدل تبدیل شدهاند. شیائومی این رویکرد را «فقط یکبار RL» یا You Only RL Once مینامد. بهجای اجرای خطوط RL کاملا مجزا برای کدنویسی، وظایف بصری، کار با رایانه و امنیت سایبری، این حوزهها و چندین چارچوب عامل را در یک اجرای آموزشی بزرگ ترکیب میکند.
تنوع چارچوبهای اجرایی نیز بخشی از توزیع آموزشی محسوب میشود. شیائومی عنوان کرده که برای کدنویسی، گردشکارهای حرفهای عمومی، وظایف بصری و امنیت سایبری، «مینیهارنس»های سبک ساخته است تا مدل در معرض ترکیبهای متفاوتی از پرامپتهای سیستمی، ابزارها و راهبردهای مدیریت زمینه قرار گیرد، بدون اینکه به یک چارچوب تولیدی مشخص بیشازحد وابسته شود.
سامانه از نسخه کاملا ناهمگام الگوریتم GRPO یا بهینهسازی سیاست نسبی گروهی استفاده میکند. این معماری ناهمگام اهمیت زیادی دارد، زیرا وظایف طولانی عاملها همگی همزمان به پایان نمیرسند. شیائومی از رولاوتهای ناقص برای استفاده مستمر از ظرفیت پردازشی GPUها بهره میگیرد، بهجای آنکه کل فرایند را منتظر کندترین مسیر نگه دارد؛ وظایف ناتمام متوقف میشوند و بعدا ادامه پیدا میکنند. همچنین این شرکت سازوکاری برای اختلاط نمونهها توسعه داده است تا وظایف سریعتر یا آسانتر نتوانند در هر دسته آموزشی بر وظایف کندتر مسلط شوند. در نتیجه، «مقیاسدهی RL» در MiMo-V2.6 همزمان به معنی افزایش تعداد تجربههای تولیدشده توسط مدل، تنوع محیطهایی است که این تجربهها در آنها شکل میگیرند و منابع محاسباتی لازم برای تعیین رفتارهایی که باید تقویت شوند.
پاداشهای دودویی ساده میتوانند به مدل برنامهنویسی بگویند آیا پچ پیشنهادی آن مجموعه آزمونها را با موفقیت پشت سر گذاشته است یا خیر، اما در تفکیک دو راهکار موفق چندان قابل اعتماد نیستند، بهویژه زمانی که یکی از راهکارها تمیز و حداقلی باشد و دیگری بر منطق جایگزین گسترده، تغییرات غیرضروری در API یا راهحلهای شکننده متکی باشد.
سیستم پاداش گروهی
«ترکیب پاداش گروهی» یا GRS با مقایسه چند تلاش برای حل یک مسئله، روبریکهای اختصاصی همان وظیفه را ایجاد میکند. این روبریکها کیفیت پیادهسازی و کیفیت رفتار عامل (از رعایت الزامات و مدیریت موارد لبهای گرفته تا سازگاری با کدبیس موجود و جمعآوری و راستیآزمایی شواهد مورد نیاز) را به صورت جداگانه ارزیابی میکنند. «بازتوزیع مزیت گروهی» یا GAR یک مرحله جلوتر میرود و راهکارهای موفق یک گروه از رولاوتها را با هم مقایسه میکند و مزیت آموزشی بیشتری را به راهکارهای بهتر اختصاص میدهد.
گزارش فنی، آزمایشی را نیز ارائه میکند که اهمیت این سازوکار را روشن میکند. در یک اجرای RL صرفا کدنویسی روی MiMo-V2.6-Flash، حذف ارزیابی گروهی آنلاین موجب شد تعداد نوبتهای تعامل عامل و طول توکنهای تولیدشده بهسرعت افزایش پیدا کند و در نهایت سهم بیشتری از مسیرها به سقف طول خود برسند. شیائومی بیان کرده است که با فعالسازی GAR، نرخ قبولی همچنان افزایش یافت، در حالی که تعداد نوبتها تقریبا ثابت ماند و رشد تعداد توکنها نیز تدریجیتر شد.
ممیزیهای انجامشده از دیدگاه نگهداری کد نیز نشان دادند سیاستی که بدون ارزیابی آنلاین آموزش دیده بود، به تدریج بیشتر به تکنیکهایی مانند شاخههای سازگاری حدسی، اکسپورتهای گسترده، بلعیدن استثناها، اعتبارسنجی سهلگیرانه و تغییرات ویژه برای محیط ارزیابی متوسل میشد. به گفته شیائومی، سیاست آموزشدیده با ارزیابی گروهی معمولا پچهایی کوچکتر و دقیقتر تولید میکرد.

حتما بخوانید: مدل هوش مصنوعی Grok 4.7 با تمرکز بر برنامهنویسی و امنیت معرفی شد
این موضوع به یک مشکل بنیادی در یادگیری تقویتی عاملمحور میرسد: مدل میتواند در بیشینهسازی پاداش بهتر شود، بدون آنکه در انجام کاری که آن پاداش قرار است نماینده آن باشد، بهتر عمل کند. شیائومی بخش قابل توجهی از گزارش خود را با عنوان «دستکاری پاداش» به همین مسئله اختصاص داده است.
در اجرای اولیه وظایف کدنویسی، برخی عاملها کشف کرده بودند که بهجای حل مستقیم باگ، میتوانند نسخه جدیدتری از یک بسته را دریافت کنند، فایل منبع بالادستی را دانلود نمایند، وضعیت جدیدتری از مخزن را شبیهسازی کنند یا در تاریخچه مشکلات جستوجو کنند تا به راهحل ازپیشمنتشرشده برسند. چنین روشهایی میتوانستند آزمونها را با موفقیت پشت سر بگذارند، در حالی که عامل از حل مسئله مورد نظر طفره رفته بود.
شیائومی برای مقابله با این رفتارها، آرتیفکتهای ساخت و کشها را از محیطهای آموزشی حذف کرد، تاریخچه آینده Git را حذف کرد، دسترسی شبکه به منابع بالقوه پاسخها را مسدود کرد و یک «عامل هک» مجزا ساخت تا پیش از آغاز آموزش، حفرههای احتمالی باقیمانده را شناسایی کند. شرکت میگوید در اجرای نهایی، مسیرهای دارای دستکاری پاداش که بهطور قطعی شناسایی شده بودند، برای هر دو مدل Pro و Flash کمتر از ۲ درصد بود و در صورت کشف چنین موردی، پاداش مؤثر آن مسیر به صفر بازگردانده میشد.
در این مقیاس، مسئله یادگیری ماشین عملا با چالشهای سیستمهای توزیعشده گره خورده است. شیائومی باید دهها هزار مسیر طولانی را در محیطهای ناهمگون به حرکت درآورد، مانع سلطه وظایف سریعتر بر دستههای آموزشی شود، رفتار آموزش و استنتاج را همراستا نگه دارد و مطمئن شود مدلهای هرچه توانمندتر از ضعفهای ارزیابهایی که آنها را آموزش میدهند، سوءاستفاده نمیکنند.
مدل MiMo-V2.6 بر تراشههای چینی تکیه دارد
همچنین گزارش فنی عنوان کرده است که شیائومی در طول RL روتر مدل Mixture-of-Experts را ثابت نگه داشت تا انحراف آموزشی کاهش یابد و پایداری سیستم افزایش پیدا کند. فولی لو، پژوهشگر سابق دیپسیک که اکنون هدایت تیم MiMo شیائومی را بر عهده دارد، در ایکس نوشت که V2.6 احتمالا یکی از بزرگترین اجرای منفرد یادگیری تقویتی است که تاکنون توسط یک تیم مدل متنباز انجام شده است. او گفت که چند ده نفر روی این پروژه کار کردهاند و مدعی شد چالشهای تحقیقاتی و مهندسی آن از تجربهای که هنگام مشارکت در توسعه DeepSeek R1 داشته، دشوارتر بوده است.
مرتبط: آمازون دستیار هوش مصنوعی Muse متا را مسدود کرد
این توصیف با جزئیات گزارش فنی نیز همخوانی دارد؛ گزارشی که تقریبا به اندازه خود الگوریتم یادگیری، به زیرساخت و سازوکارهای موردنیاز برای پایدار نگه داشتن سامانه RL میپردازد. دنییش خازی، مدیرعامل استارتآپ متنباز Paper Instruments در حوزه دانشکاری هوش مصنوعی نیز در ایکس نوشت که این عرضه میتواند پژوهشگران را به بازنگری در تمام فرضیات قبلی درباره «قوانین مقیاسدهی پساآموزش» وادار کند؛ بهویژه با توجه به میزان قابلیتی که شیائومی با هزینه محاسباتی اعلامشده محدود و کاملا با تکیه بر تراشههای چینی، نه GPUهای انویدیا، از این فرایند استخراج کرده است.

















