• صفحه اصلی
  • همه اخبار
  • تبلیغات تکناک
  • درباره ما
  • تماس با ما
اخبار تکنولوژی روز جهان و ایران
  • فناوری
    • اخبار هوش مصنوعی
    • رباتیک
    • اینترنت و شبکه
    • شبکه های اجتماعی
    • هوافضا
    • معماری
    • ورزش
    • رویداد ها
    • دوربین دیجیتال
  • کامپیوتر و موبایل
    • موبایل و تبلت
    • لپ تاپ و کامپیوتر
    • اپلیکیشن موبایل
    • نرم افزار
    • سخت افزار
    • ساعت هوشمند
    • مانیتور
    • اسپیکر و هدفون
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
  • نقد و بررسی
    • بررسی موبایل و تبلت
    • کنسول بازی
    • بررسی لپ تاپ و کامپیوتر
    • قطعات کامپیوتر
    • نرم افزار
    • بررسی اسپیکر و هدفون
    • بررسی ساعت هوشمند
  • آموزش
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
    • آموزش هوش مصنوعی
    • سخت افزار
  • اخبار ارز دیجیتال
    • قیمت لحظه ای ارز دیجیتال
    • ماشین حساب ارز دیجیتال
    • آموزش ارز دیجیتال
  • علمی
    • سلامت و پزشکی
    • انرژی
    • فیزیک
    • شیمی
    • نجوم
    • ورزش
    • محیط زیست
    • باستان شناسی
  • کسب و کار
    • شرکت ها
    • بورس
    • مدیریت(پروژه، کسب و کار، منابع انسانی)
    • استارتاپ ها
    • دولت الکترونیک
    • رویداد کسب و کار
  • وسائل نقلیه
    • خودرو
    • دوچرخه
    • موتور سیکلت
    • قطار
    • هواپیما
  • بازی و سرگرمی
    • کنسول بازی های کامپیوتری
    • بازی های کامپیوتر
    • بازی کنسول
    • بازی موبایل
    • فیلم و سریال
  • چند رسانه ای
    • عکس
    • ویدئو
  • اخبار داخلی
    • دانش بنیان
    • دولت الکترونیک
    • رویداد داخلی
    • بازار
    • دانشگاه
No Result
مشاهده تمامی نتایج
اخبار تکنولوژی روز جهان و ایران
  • فناوری
    • اخبار هوش مصنوعی
    • رباتیک
    • اینترنت و شبکه
    • شبکه های اجتماعی
    • هوافضا
    • معماری
    • ورزش
    • رویداد ها
    • دوربین دیجیتال
  • کامپیوتر و موبایل
    • موبایل و تبلت
    • لپ تاپ و کامپیوتر
    • اپلیکیشن موبایل
    • نرم افزار
    • سخت افزار
    • ساعت هوشمند
    • مانیتور
    • اسپیکر و هدفون
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
  • نقد و بررسی
    • بررسی موبایل و تبلت
    • کنسول بازی
    • بررسی لپ تاپ و کامپیوتر
    • قطعات کامپیوتر
    • نرم افزار
    • بررسی اسپیکر و هدفون
    • بررسی ساعت هوشمند
  • آموزش
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
    • آموزش هوش مصنوعی
    • سخت افزار
  • اخبار ارز دیجیتال
    • قیمت لحظه ای ارز دیجیتال
    • ماشین حساب ارز دیجیتال
    • آموزش ارز دیجیتال
  • علمی
    • سلامت و پزشکی
    • انرژی
    • فیزیک
    • شیمی
    • نجوم
    • ورزش
    • محیط زیست
    • باستان شناسی
  • کسب و کار
    • شرکت ها
    • بورس
    • مدیریت(پروژه، کسب و کار، منابع انسانی)
    • استارتاپ ها
    • دولت الکترونیک
    • رویداد کسب و کار
  • وسائل نقلیه
    • خودرو
    • دوچرخه
    • موتور سیکلت
    • قطار
    • هواپیما
  • بازی و سرگرمی
    • کنسول بازی های کامپیوتری
    • بازی های کامپیوتر
    • بازی کنسول
    • بازی موبایل
    • فیلم و سریال
  • چند رسانه ای
    • عکس
    • ویدئو
  • اخبار داخلی
    • دانش بنیان
    • دولت الکترونیک
    • رویداد داخلی
    • بازار
    • دانشگاه
No Result
مشاهده تمامی نتایج
اخبار تکنولوژی روز جهان و ایران
تک ناک فناوری اخبار هوش مصنوعی

ظرفیت واقعی حافظه مدل‌های زبانی بزرگ هوش مصنوعی آشکار شد

نرگس چالوک نوشته شده توسط نرگس چالوک
دوشنبه 19 خرداد 1404 - 15:50
در اخبار هوش مصنوعی, فناوری
ظرفیت واقعی حافظه مدل‌های زبانی بزرگ هوش مصنوعی آشکار شد
کپی لینکاشتراک گذاری در تلگراماشتراک گذاری در توییتر

مطالعه‌ای مشترک از سوی پژوهشگران متا، گوگل، انویدیا و دانشگاه کرنل برای نخستین‌بار به‌ صورت دقیق نشان داده است که حافظه مدل‌های زبانی بزرگ (LLM) چه میزان از داده‌های آموزشی خود را «حفظ» می‌کنند.

به گزارش تک‌ناک، نتایج این تحقیق نشان می‌دهد که مدل‌های مبتنی بر ساختار GPT ظرفیت ثابتی برای حافظه‌سپاری دارند، که برابر با ۳.۶ بیت به ازای هر پارامتر است. به بیان دیگر، یک مدل با ۱.۵ میلیارد پارامتر، تنها حدود ۶۷۵ مگابایت اطلاعات خام را به‌ صورت مستقیم ذخیره می‌کند؛ رقمی که در مقایسه با مجموعه داده‌های تریلیون‌واژه‌ای بسیار ناچیز به نظر می‌رسد.

فهرست مطالب

  • آموزش مدل‌های زبانی بزرگ؛ از واژه تا مفهوم
  • کشف عددی بنیادین: ۳.۶ بیت به ازای هر پارامتر
  • داده بیشتر، حفظ کمتر
  • داده بیشتر، مدل امن‌تر

آموزش مدل‌های زبانی بزرگ؛ از واژه تا مفهوم

مدل‌های زبانی بزرگ همچون ChatGPT، Claude شرکت Anthropic و Gemini گوگل با تریلیون‌ها واژه از منابع گوناگون شامل وب‌سایت‌ها، کتاب‌ها، پایگاه‌های کد، تصاویر، صوت و ویدیو آموزش دیده‌اند. این مدل‌ها از دل چنین داده‌هایی، درکی آماری و تعمیم‌یافته از زبان و جهان پیرامون به‌دست می‌آورند. در این فرایند، میلیاردها پارامتر تنظیم می‌شود تا خروجی مدل، پاسخ‌هایی متناسب با الگوهای زبانی و مفهومی مشاهده‌شده در داده‌ها باشد.

اما همیشه این نگرانی وجود داشته که مدل‌ها ممکن است به‌جای تعمیم مفاهیم، صرفاً محتوای آموزش‌دیده را حفظ و بازتولید کنند. این مسئله به‌ویژه از منظر حقوقی و نقض احتمالی کپی‌رایت اهمیت فراوانی دارد.

کشف عددی بنیادین: ۳.۶ بیت به ازای هر پارامتر

پژوهش جدید نشان می‌دهد که مدل‌های GPT‌محور دارای ظرفیت حافظه‌ای ثابت و قابل اندازه‌گیری هستند، که ۳٫۶ بیت به ازای هر پارامتر است. این عدد به زبان ساده یعنی هر پارامتر تنها توانایی حفظ حدود ۱۲ مقدار متفاوت را دارد، که تقریباً معادل انتخاب یک ماه از سال یا نتیجه یک تاس ۱۲وجهی است. این مقدار حتی برای ذخیره یک کاراکتر کامل در زبان انگلیسی (که حدود ۴٫۷ بیت نیاز دارد) کافی نیست.

پژوهشگران با آموزش مدل‌های ترنسفورمر بر رشته‌هایی از بیت‌های کاملاً تصادفی، امکان هرگونه تعمیم را حذف کردند. در چنین شرایطی، عملکرد مدل‌های زبانی بزرگ در بازشناسی داده‌ها تنها می‌تواند ناشی از حافظه باشد. آنها از طریق این روش، رابطه مستقیمی میان تعداد پارامترها و میزان حافظه قابل ذخیره شناسایی کردند.

نتایج حافظه مدل‌های زبانی بزرگ با اندازه‌های مختلف — از ۵۰۰هزار تا ۱٫۵ میلیارد پارامتر — یکسان بود. حتی افزایش دقت عددی مدل از bfloat16 به float32 تنها باعث افزایش اندکی در ظرفیت حافظه (از ۳٫۵۱ به ۳٫۸۳ بیت) شد.

کشف ظرفیت واقعی حافظه مدل‌های زبانی بزرگ هوش مصنوعی

داده بیشتر، حفظ کمتر

برخلاف تصور رایج، آموزش مدل با داده بیشتر باعث افزایش حفظ‌شدگی نمی‌شود. به گفته جک موریس، نویسنده اصلی مقاله، آموزش با داده بیشتر باعث می‌شود که مدل‌ها به ازای هر نمونه، اطلاعات کمتری حفظ کنند. به‌ عبارت دیگر، داده بیشتر به معنای تعمیم بیشتر و حافظه کمتر است، که موضوعی حیاتی در مباحث حقوقی و اخلاقی مربوط به مدل‌های زبانی می‌شود.

همچنین این مطالعه نشان می‌دهد که حملات استنتاج عضویت — که برای تشخیص وجود یک داده خاص در مجموعه آموزشی طراحی شده‌اند — با افزایش حجم داده‌ها ناکارآمدتر می‌شوند. این یافته می‌تواند به کاهش نگرانی‌ها پیرامون افشای اطلاعات حساس یا دارای کپی‌رایت توسط LLMها کمک کند.

با وجود این، نویسندگان مقاله بیان کردند که داده‌های خاص و منحصربه‌فرد — مانند متون با سبک بسیار ویژه یا هنری — همچنان ممکن است بیشتر حفظ شوند. با وجود این‌، رویکرد آنها برای بررسی روندهای کلی طراحی شده است و به استثناها توجهی ندارند.

داده بیشتر، مدل امن‌تر

این پژوهش گامی مهم در جهت درک دقیق‌ عملکرد مدل‌های زبانی بزرگ و تفکیک حافظه از یادگیری محسوب می‌شود. یافته‌ها نشان می‌دهند که استفاده از داده‌های بیشتر نه‌تنها باعث تعمیم بهتر مدل می‌شود، بلکه ریسک بازتولید محتوای حساس یا تحت کپی‌رایت را نیز کاهش می‌دهد.

به‌ عنوان نمونه، یک مدل با ۵۰۰ هزار پارامتر می‌تواند حدود ۲۲۵ کیلوبایت داده حفظ کند، در حالی که ظرفیت حافظه یک مدل ۱٫۵ میلیارد پارامتری حدود ۶۷۵ مگابایت تخمین زده می‌شود. این میزان در مقایسه با فایل‌های رسانه‌ای زیاد نیست، اما در دنیای متن و زبان، معنا و اهمیت ویژه‌ای دارد.

با توجه به دعواهای حقوقی پرشمار میان توسعه‌دهندگان هوش مصنوعی و صاحبان محتوا، بی‌تردید این پژوهش به‌ عنوان مرجعی علمی و قانونی در بررسی عملکرد و مسئولیت مدل‌های زبانی مورد استناد قرار خواهد گرفت.

نرگس چالوک

نرگس چالوک

مطالب مرتبط

شرکت دیپ‌سیک تمام محتوای تولیدی با هوش مصنوعی را برچسب‌گذاری می‌کند
اخبار هوش مصنوعی

شرکت دیپ‌سیک تمام محتوای تولیدی با هوش مصنوعی را برچسب‌گذاری می‌کند

نوشته شده توسط اسما کلهر
10 شهریور 1404
آزمایشگاه تصویربرداری خودکار تکنو
رباتیک

تکنو و دکزومارک در چین اولین آزمایشگاه تمام‌خودکار تصویربرداری جهان را افتتاح کردند

نوشته شده توسط امیرحسین یونس
10 شهریور 1404
آسیب‌پذیری چت‌بات‌ها دربرابر تکنیک‌های روان‌شناسی
اخبار هوش مصنوعی

چت‌بات‌ها با تاکتیک‌های روان‌شناسی دست‌کاری می‌شوند

نوشته شده توسط امیرحسین یونس
10 شهریور 1404
زلزله مرگبار در افغانستان ۸۰۰ کشته و هزاران زخمی بر جا گذاشت
فناوری

زلزله مرگ‌بار در افغانستان ۸۰۰ کشته و هزاران زخمی بر جای گذاشت

نوشته شده توسط امیرحسین یونس
10 شهریور 1404
چت‌بات Asa اپل
اخبار هوش مصنوعی

اپل برای کارمندان پشتیبانی و فروش چت‌بات معرفی کرد

نوشته شده توسط امیرحسین یونس
10 شهریور 1404
خبر بعدی
سیگیت کارت حافظه ۴ ترابایتی جدید خود را برای Xbox معرفی کرد؛ قیمتی بالاتر از Xbox Series S

رونمایی کارت حافظه ۴ ترابایتی سیگیت برای ایکس‌باکس با قیمتی بیشتر از کنسول سری S

دیدگاهتان را بنویسید لغو پاسخ

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

آذرآنلاین آذرآنلاین آذرآنلاین

پیشنهادی

راهنمای جامع تبدیل عکس به متن با ابزارهای OCR؛ از موبایل تا کامپیوتر

راهنمای جامع تبدیل عکس به متن با ابزارهای OCR؛ از موبایل تا کامپیوتر

12 مرداد 1404 - به‌روزشده در 13 مرداد 1404
راهنمای کامل تغییر فونت اینستاگرام

راهنمای کامل تغییر فونت اینستاگرام

10 شهریور 1404

داغ‌ترین‌های روز

بهترین گوشی سامسونگ از نظر دوربین

بهترین گوشی‌های سامسونگ از نظر دوربین (تابستان ۱۴۰۴)

7 شهریور 1404 - به‌روزشده در 8 شهریور 1404
۳۱ گوشی‌ هوشمند شیائومی از دریافت به‌روزرسانی اندروید 16 محروم می‌شوند

این 31 مدل گوشی‌ شیائومی به‌روزرسانی اندروید 16 را دریافت نمی‌کنند

4 شهریور 1404 - به‌روزشده در 5 شهریور 1404
پیش‌بینی قیمت بیت‌کوین، اتریوم و ریپل؛ چه سرنوشتی در انتظار سه تفنگدار بازار در ماه سپتامبر است؟

پیش‌بینی قیمت بیت‌کوین، اتریوم و ریپل؛ چه سرنوشتی در انتظار سه تفنگدار بازار در ماه سپتامبر است؟

9 شهریور 1404
بهترین فیلم ‌های گلادیاتوری جهان

بهترین فیلم ‌های گلادیاتوری جهان

7 شهریور 1404 - به‌روزشده در 9 شهریور 1404
رونمایی گوشی‌های پرچمدار در سپتامبر

هفت پرچمدار اندرویدی ساخت شرکت‌های چینی در ماه سپتامبر معرفی می‌شوند

6 شهریور 1404 - به‌روزشده در 9 شهریور 1404
تک ناک - اخبار تکنولوژی روز جهان و ایران

دنیا با سرعتی خیره کننده به سمت تحقق رویاهایی می رود که تا دیروز دست نیافتنی و محال بود و بشر با گذر از دریایی از موانع یک به یک در حال تحقق آنها است.

ما در” تک ناک” تلاش می کنیم سهمی از انعکاس تحولات بی شمار فناوری و اخبار تکنولوژی داشته باشیم و در این کهکشان بی انتهای یافته های علمی و دانش محور محتوایی قابل اتکاء و اخباری موثق را از گوشه و کنار دنیا در اختیار علاقمندان و مخاطبان خود قرار دهیم.

ما را در شبکه های اجتماعی دنبال کنید

تازه‌ها

شرکت دیپ‌سیک تمام محتوای تولیدی با هوش مصنوعی را برچسب‌گذاری می‌کند

شرکت دیپ‌سیک تمام محتوای تولیدی با هوش مصنوعی را برچسب‌گذاری می‌کند

10 شهریور 1404
ادیفایر از ایرباد Lolli Pro SE با حذف نویز ۴۸ دسی‌بلی و عمر باتری ۴۳ ساعته رونمایی کرد

این هدفون‌ها با ۴۳ ساعت شارژدهی عرضه می‌شوند

10 شهریور 1404
اپل واچ SE 3 تغییر نام می‌دهد؛ انتظار برای نسخه 11e

اپل واچ SE 3 تغییر نام می‌دهد؛ انتظار برای نسخه 11e

10 شهریور 1404
گوگل کروم آپدیت شد؛ طراحی جدید برای نسخه پایدار

گوگل کروم آپدیت شد؛ طراحی جدید برای نسخه پایدار

10 شهریور 1404

دسترسی سریع

  • فناوری
  • کامپیوتر و موبایل
  • نقد و بررسی
  • آموزش
  • ارز دیجیتال
  • علمی
  • کسب و کار
  • وسائل نقلیه
  • بازی و سرگرمی
  • چند رسانه ای
  • صفحه اصلی
  • همه اخبار
  • تبلیغات تکناک
  • درباره ما
  • تماس با ما

© Copyright 2025 Technoc.ir

technoc-instagram
No Result
مشاهده تمامی نتایج
  • فناوری
    • اخبار هوش مصنوعی
    • رباتیک
    • اینترنت و شبکه
    • شبکه های اجتماعی
    • هوافضا
    • معماری
    • ورزش
    • رویداد ها
    • دوربین دیجیتال
  • کامپیوتر و موبایل
    • موبایل و تبلت
    • لپ تاپ و کامپیوتر
    • اپلیکیشن موبایل
    • نرم افزار
    • سخت افزار
    • ساعت هوشمند
    • مانیتور
    • اسپیکر و هدفون
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
  • نقد و بررسی
    • بررسی موبایل و تبلت
    • کنسول بازی
    • بررسی لپ تاپ و کامپیوتر
    • قطعات کامپیوتر
    • نرم افزار
    • بررسی اسپیکر و هدفون
    • بررسی ساعت هوشمند
  • آموزش
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
    • آموزش هوش مصنوعی
    • سخت افزار
  • اخبار ارز دیجیتال
    • قیمت لحظه ای ارز دیجیتال
    • ماشین حساب ارز دیجیتال
    • آموزش ارز دیجیتال
  • علمی
    • سلامت و پزشکی
    • انرژی
    • فیزیک
    • شیمی
    • نجوم
    • ورزش
    • محیط زیست
    • باستان شناسی
  • کسب و کار
    • شرکت ها
    • بورس
    • مدیریت(پروژه، کسب و کار، منابع انسانی)
    • استارتاپ ها
    • دولت الکترونیک
    • رویداد کسب و کار
  • وسائل نقلیه
    • خودرو
    • دوچرخه
    • موتور سیکلت
    • قطار
    • هواپیما
  • بازی و سرگرمی
    • کنسول بازی های کامپیوتری
    • بازی های کامپیوتر
    • بازی کنسول
    • بازی موبایل
    • فیلم و سریال
  • چند رسانه ای
    • عکس
    • ویدئو
  • اخبار داخلی
    • دانش بنیان
    • دولت الکترونیک
    • رویداد داخلی
    • بازار
    • دانشگاه

© Copyright 2025 Technoc.ir