فهرست مطالب
یک مدل هوش مصنوعی با ۱۲.۵ میلیون پارامتر، با استفاده از کارت گرافیک RTX 3080 Ti، بازی پوکمون رد را یاد گرفت و توانست Squirtle را به عنوان پوکمون آغازین انتخاب کند.
به گزارش سرویس سخت افزار تکناک، تکناک، توسعهدهندهای با نام مستعار stmonty، مدلی کوچک از هوش مصنوعی را روی یک کارت گرافیک RTX 3080 Ti آموزش داده تا در بازی Pokémon Red یک پوکمون آغازین انتخاب کند. این مدل در نهایت توانست از یک فایل ذخیره بازی، Squirtle را انتخاب کند. هرچند هنوز نمیتواند بازی را از ابتدا آغاز کند یا تا پایان پیش ببرد، نتیجه نشان میدهد که حتی مدلهای نسبتاً کوچک نیز میتوانند برای انجام وظایفی مشخص آموزش ببینند.
stmonty در نوشتهای با عنوان «Teaching a World Model to Play Pokémon» روند این پروژه را شرح داده است. مدل مورد استفاده از نوع مدل جهانی است و بر پایه پژوهش LeWorldModel ساخته شده؛ پژوهشی که Yann LeCun، دانشمند شناختهشده حوزه هوش مصنوعی، در نگارش آن مشارکت داشته است. LeCun سال گذشته از Meta جدا شد تا از طریق شرکت AMI Labs روی توسعه مدلهای جهانی کار کند.
انتشار کد پروژه بهصورت متنباز
مدل stmonty حدود ۱۲.۵ میلیون پارامتر دارد و در ۲۰ سپتامبر معرفی شد. انتخاب مدلی کوچک بخشی از هدف پروژه بود، زیرا توسعهدهنده میخواست آن را بهصورت محلی و روی یک کارت گرافیک مصرفکننده آموزش دهد. او این کار را راهی برای یادگیری و سرگرمی توصیف کرده است. کد پروژه نیز بهصورت متنباز با نام lePokeRed در GitHub منتشر شده و برای اجرای آن استفاده از پردازنده گرافیکی سازگار با CUDA توصیه میشود.
مدل باید از راه مشاهده صفحه بازی Pokémon Red یاد میگرفت که فشردن هر دکمه چه نتیجهای دارد. برای این کار، به جای پیشبینی کامل تصویر بعدی، از خلاصهای فشرده شامل ۱۹۲ عدد استفاده میکند. در مرحله نخست آموزش، مدل هیچ پاداشی دریافت نمیکند و از شرایط پیروزی یا هدف نهایی آگاه نیست. اهداف زمانی وارد فرایند میشوند که مدل شروع به برنامهریزی میکند.

این ساختار با پژوهشی منتشرشده در مارس ۲۰۲۶ همراستا است. آن پژوهش یک مدل JEPA با حدود ۱۵ میلیون پارامتر را شرح میدهد که میتوان آن را روی یک پردازنده گرافیکی آموزش داد. اندازه و شیوه اجرای آن نیز تفاوت زیادی با پروژه stmonty ندارد.
فرآیند آموزش با فریمهای سیاهوسفید
آموزش مدل با ۴۲۳۸۲ فریم سیاهوسفید انجام شد که در بیش از هزار اجرای کوتاه گردآوری شده بودند. نقطه آغاز همه این اجراها، فایلی ذخیرهشده در آزمایشگاه Professor Oak بود. دادههای آموزشی تنها شامل مسیرهای از پیش تعیینشده نبودند و مسیرهای مشابه با فشردن تصادفی دکمهها و همچنین گشتوگذار بیهدف را هم در بر میگرفتند.
افزودن دادههای تصادفی اهمیت داشت، چون مدلی که فقط مسیرهای تمیز و تکرارشونده را ببیند، ممکن است ارتباطی نادرست میان دکمهها و اتفاقات بازی برقرار کند. برای نمونه، اگر هر بار با نمایش یک کادر گفتگو دکمه A فشرده شود، مدل ممکن است هرگز یاد نگیرد که دکمه B در همان موقعیت چه کاری انجام میدهد. مدل پروژه نیز از ابتدا و بدون استفاده از مدلی آماده آموزش داده شد.
در مرحله برنامهریزی، مدل دنبالهای شامل ۱۴ بار فشردن دکمه را میسازد و آن را در خود مدل امتحان میکند، نه در بازی اصلی. در هر دور، ۵۱۲ برنامه احتمالی بررسی میشوند. فرایند جستوجو از هر هشت برنامه یکی را نگه میدارد و در نتیجه، ۶۴ گزینه برای ادامه باقی میماند. این روند تا انتخاب برنامه نهایی ادامه پیدا میکند و سپس همان برنامه در شبیهساز بازی اجرا میشود.
نخستین تلاش موفق نبود و شخصیت بازی بدون پوکمون باقی ماند. stmonty احتمال میدهد بخشی از مشکل به انباشته شدن خطاها مربوط باشد: مدل پیشبینیهای خود را مبنای پیشبینیهای بعدی قرار میدهد و اشتباههای کوچک ممکن است در ادامه بزرگتر شوند. پس از تنظیم دقیقتر مدل، تلاش بعدی نتیجه داد و Squirtle انتخاب شد.
اهمیت دادههای آموزشی تصادفی
بهنوشته تامز هاردور، در بیش از ۱۰۰ اجرای بعدی که همگی از همان فایل ذخیره شروع شدند، ۵۲ برنامه توانستند یک پوکمون آغازین انتخاب کنند. در مقایسه، فشردن تصادفی دکمهها هیچبار به انتخاب پوکمون منجر نشد و مدل آموزشندیده فقط یکبار موفق شد. با این حال، فشردن مکرر دکمه A از همان فایل ذخیره نیز از قبل نتیجه میداد. هدف اصلی پروژه، رسیدن مدل به راهحل بهصورت مستقل بود، نه صرفاً انجام دادن یک دستور ساده و از پیش معلوم.
گام بعدی میتواند آموزش مدل برای شروع از آزمایشگاه، رفتن به سمت Professor Oak، پیش بردن گفتگو و سپس انتخاب پوکمون باشد. stmonty معتقد است دشواری کار با طول برنامهها بهصورت تصاعدی افزایش مییابد. او همچنین بعید میداند که بزرگتر کردن مدل فعلی بهتنهایی برای شکست دادن بازی کافی باشد.
این پروژه در کنار تلاشهای اخیر دیگری قرار میگیرد که با استفاده از مدل تصمیمگیری Jev و ابزارهای کمکی یا کدهای سفارشی توانستهاند Pokémon Red را به پایان برسانند. آن روشها پیچیدهتر هستند، اما تجربه stmonty نشان میدهد مدلهای کوچک نیز میتوانند گزینهای عملی برای علاقهمندان باشند؛ بهویژه زمانی که هدف، آموزش هوش مصنوعی برای یک کار محدود و مشخص باشد.

















