• صفحه اصلی
  • همه اخبار
  • تبلیغات تکناک
  • درباره ما
  • تماس با ما
اخبار تکنولوژی روز جهان و ایران
  • فناوری
    • اخبار هوش مصنوعی
    • رباتیک
    • اینترنت و شبکه
    • شبکه های اجتماعی
    • هوافضا
    • معماری
    • ورزش
    • رویداد ها
    • دوربین دیجیتال
  • کامپیوتر و موبایل
    • موبایل و تبلت
    • لپ تاپ و کامپیوتر
    • اپلیکیشن موبایل
    • نرم افزار
    • سخت افزار
    • ساعت هوشمند
    • مانیتور
    • اسپیکر و هدفون
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
  • نقد و بررسی
    • بررسی موبایل و تبلت
    • کنسول بازی
    • بررسی لپ تاپ و کامپیوتر
    • قطعات کامپیوتر
    • نرم افزار
    • بررسی اسپیکر و هدفون
    • بررسی ساعت هوشمند
  • آموزش
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
    • آموزش هوش مصنوعی
    • سخت افزار
  • اخبار ارز دیجیتال
    • قیمت لحظه ای ارز دیجیتال
    • ماشین حساب ارز دیجیتال
    • آموزش ارز دیجیتال
  • علمی
    • سلامت و پزشکی
    • انرژی
    • فیزیک
    • شیمی
    • نجوم
    • ورزش
    • محیط زیست
    • باستان شناسی
  • کسب و کار
    • شرکت ها
    • بورس
    • مدیریت(پروژه، کسب و کار، منابع انسانی)
    • استارتاپ ها
    • دولت الکترونیک
    • رویداد کسب و کار
  • وسائل نقلیه
    • خودرو
    • دوچرخه
    • موتور سیکلت
    • قطار
    • هواپیما
  • بازی و سرگرمی
    • کنسول بازی های کامپیوتری
    • بازی های کامپیوتر
    • بازی کنسول
    • بازی موبایل
    • فیلم و سریال
  • چند رسانه ای
    • عکس
    • ویدئو
  • اخبار داخلی
    • دانش بنیان
    • دولت الکترونیک
    • رویداد داخلی
    • بازار
    • دانشگاه
No Result
مشاهده تمامی نتایج
اخبار تکنولوژی روز جهان و ایران
  • فناوری
    • اخبار هوش مصنوعی
    • رباتیک
    • اینترنت و شبکه
    • شبکه های اجتماعی
    • هوافضا
    • معماری
    • ورزش
    • رویداد ها
    • دوربین دیجیتال
  • کامپیوتر و موبایل
    • موبایل و تبلت
    • لپ تاپ و کامپیوتر
    • اپلیکیشن موبایل
    • نرم افزار
    • سخت افزار
    • ساعت هوشمند
    • مانیتور
    • اسپیکر و هدفون
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
  • نقد و بررسی
    • بررسی موبایل و تبلت
    • کنسول بازی
    • بررسی لپ تاپ و کامپیوتر
    • قطعات کامپیوتر
    • نرم افزار
    • بررسی اسپیکر و هدفون
    • بررسی ساعت هوشمند
  • آموزش
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
    • آموزش هوش مصنوعی
    • سخت افزار
  • اخبار ارز دیجیتال
    • قیمت لحظه ای ارز دیجیتال
    • ماشین حساب ارز دیجیتال
    • آموزش ارز دیجیتال
  • علمی
    • سلامت و پزشکی
    • انرژی
    • فیزیک
    • شیمی
    • نجوم
    • ورزش
    • محیط زیست
    • باستان شناسی
  • کسب و کار
    • شرکت ها
    • بورس
    • مدیریت(پروژه، کسب و کار، منابع انسانی)
    • استارتاپ ها
    • دولت الکترونیک
    • رویداد کسب و کار
  • وسائل نقلیه
    • خودرو
    • دوچرخه
    • موتور سیکلت
    • قطار
    • هواپیما
  • بازی و سرگرمی
    • کنسول بازی های کامپیوتری
    • بازی های کامپیوتر
    • بازی کنسول
    • بازی موبایل
    • فیلم و سریال
  • چند رسانه ای
    • عکس
    • ویدئو
  • اخبار داخلی
    • دانش بنیان
    • دولت الکترونیک
    • رویداد داخلی
    • بازار
    • دانشگاه
No Result
مشاهده تمامی نتایج
اخبار تکنولوژی روز جهان و ایران

تک ناک » فناوری » جنجال بر سر بنچمارک‌های Grok 3؛ آیا xAI واقعیت را تحریف کرده است؟

جنجال بر سر بنچمارک‌های Grok 3؛ آیا xAI واقعیت را تحریف کرده است؟

سید محمد برازنده نوشته شده توسط سید محمد برازنده
یکشنبه 5 اسفند 1403 - 15:00
در اخبار هوش مصنوعی, فناوری
جنجال بر سر بنچمارک‌های Grok 3؛ آیا xAI واقعیت را تحریف کرده است؟
کپی لینکاشتراک گذاری در تلگراماشتراک گذاری در توییتر

شرکت OpenAI، استارت‌آپ xAi متعلق به ایلان ماسک را به گمراه کردن مخاطبان در ارائه بنچمارک‌های مربوط به هوش مصنوعی Grok 3 متهم کرد.

به گزارش تک‌ناک، ایگور بابوشکین، یکی از هم‌بنیان‌گذاران xAI، این اتهام را رد و از صحت عملکرد شرکت خود دفاع کرده است. بحث‌ها پیرامون بنچمارک‌های هوش مصنوعی و نحوه ارائه آنها توسط شرکت‌های فعال در این حوزه، اکنون به فضای عمومی کشیده شده است.

استارت‌آپ xAI در وبلاگ رسمی خود نموداری منتشر کرد که عملکرد Grok 3 را در آزمون ریاضی AIME 2025 به نمایش می‌گذاشت. برخی متخصصان، اعتبار این آزمون را به‌ عنوان یک معیار سنجش هوش مصنوعی زیر سؤال برده‌اند، با وجود این‌، AIME 2025 و نسخه‌های پیشین آن اغلب برای ارزیابی توانایی ریاضی مدل‌ها به کار می‌روند.

جنجال بر سر بنچمارک‌های هوش مصنوعی Grok 3

بر اساس این نمودار و نتایج بنچمارک‌ها، دو نسخه از Grok 3، یعنی Grok 3 Reasoning Beta و Grok 3 mini Reasoning، موفق شده‌اند مدل o3-mini-high، که بهترین مدل موجود OpenAI است را در آزمون AIME 2025 شکست دهند. اما کارکنان OpenAI در X به سرعت واکنش نشان دادند و تأکید کردند که این نمودار، امتیاز مدل o3-mini-high را در معیار “cons@64” لحاظ نکرده است.

اما “cons@64” چیست؟ این معیار که مخفف “consensus@64” است، به مدل اجازه می‌دهد 64 بار به هر سؤال پاسخ دهد و در نهایت، پرتکرارترین پاسخ را به‌ عنوان جواب نهایی در نظر می‌گیرد. این روش اغلب باعث افزایش چشمگیر امتیاز مدل‌ها در بنچمارک‌ها می‌شود. حذف این معیار از نمودار می‌تواند این تصور را ایجاد کند که یک مدل از مدل دیگر برتر است، در حالی‌ که در عمل اینگونه نیست.

در معیار “@1” – که نشان‌دهنده امتیاز اولیه مدل‌ها در اولین تلاش است – امتیازات Grok 3 Reasoning Beta و Grok 3 mini Reasoning کمتر از امتیاز o3-mini-high است. علاوه بر این، Grok 3 Reasoning Beta حتی اندکی پایین‌تر از مدل o1 شرکت OpenAI با تنظیمات “medium” قرار می‌گیرد. با وجود این‌، xAI همچنان Grok 3 را به‌ عنوان «باهوش‌ترین هوش مصنوعی جهان» معرفی کرده است.

بابوشکین در X استدلال کرد که OpenAI نیز در گذشته نمودارهای مشابهی منتشر کرده است، هرچند که این نمودارها مربوط به مقایسه مدل‌های خود شرکت بوده‌اند. در همین حال، یک تحلیلگر مستقل نموداری دقیق‌تر منتشر کرده است، که عملکرد تمامی مدل‌ها را در معیار cons@64 نشان می‌دهد.

با وجود این‌، همان‌طور که ناتان لمبرت، محقق هوش مصنوعی اشاره کرده است، شاید مهم‌ترین عامل همچنان نامشخص باشد، اینکه هزینه محاسباتی و مالی هر مدل برای رسیدن به بهترین امتیاز در چه حدی بوده است.

این موضوع نشان می‌دهد که بنچمارک‌های هوش مصنوعی تنها بخش کوچکی از تصویر کلی را نمایش می‌دهند و اطلاعات کاملی درباره محدودیت‌ها و نقاط قوت مدل‌ها ارائه نمی‌کنند.

سید محمد برازنده

سید محمد برازنده

کارشناسی مترجمی زبان فرانسه. از سال 87 تاکنون در حوزه های مختلف سابقه ترجمه دارم. بیش از یک سال هست که مترجم حوزه فناوری تو سایت تک ناک هستم.

مطالب مرتبط

Gemini با Nano Banana و تشخیص SynthID
اخبار هوش مصنوعی

افزایش قابلیت‌های اپلیکیشن جمنای

نوشته شده توسط اسما کلهر
27 آذر 1404
ترامپ مدیا، شرکت پشت پلتفرم رسانه اجتماعی شخصی رئیس جمهور، تروث سوشال
فناوری

ادغام عجیب شبکه اجتماعی ترامپ با شرکت انرژی گوگل

نوشته شده توسط اسما کلهر
27 آذر 1404
ایلان ماسک با کت و شلوار و چهره‌ای خندان در مرکز تصویر، در میان جمعیتی که فوکوس ندارند (احتمالا جلسه xAI).
اخبار هوش مصنوعی

برنامه ایلان ماسک برای دستیابی xAI به هوش عمومی مصنوعی تا ۲۰۲۶

نوشته شده توسط اسما کلهر
27 آذر 1404
نمای کلوزآپ از صفحه‌کلید رایانه با کلیدی حاوی پرچم کره شمالی، نماد مفهومی از تهدیدات سایبری، هک و فعالیت‌ های دیجیتال منتسب به پیونگ‌یانگ
امنیت سایبری

کره‌شمالی به سیستم مدیریت آمازون نفوذ کرد

نوشته شده توسط تارخ ترهنده
27 آذر 1404
نمای هوایی نیروگاه حرارتی با چهار برج خنک‌کن و دودکش اصلی، انتشار بخار آب به آسمان و قرارگیری تاسیسات صنعتی در حاشیه شهر
اخبار هوش مصنوعی

مصرف انرژی هوش مصنوعی از استخراج بیت‌کوین در سال ۲۰۲۴ پیشی گرفت

نوشته شده توسط تارخ ترهنده
27 آذر 1404
خبر بعدی
رونمایی از مانیتور گیمینگ 520 هرتزی XG2737 ویوسونیک

رونمایی از مانیتور گیمینگ 520 هرتزی XG2737 ویوسونیک

دیدگاهتان را بنویسید لغو پاسخ

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

آذرآنلاین آذرآنلاین آذرآنلاین

پیشنهادی

بررسی ایسر نیترو V 15

نقد و بررسی Acer Nitro V 15: بهترین لپ‌تاپ گیمینگ اقتصادی ایسر

16 آذر 1404 - به‌روزشده در 17 آذر 1404
اتوماسیون خانه هوشمند

۱۰ سناریو و اتوماسیون خلاقانه خانه هوشمند

23 آذر 1404 - به‌روزشده در 24 آذر 1404

داغ‌ترین‌های روز

شیائومی شروع به انتشار به‌روزرسانی امنیتی دسامبر ۲۰۲۵ کرد

شیائومی انتشار به‌روزرسانی امنیتی دسامبر ۲۰۲۵ HyperOS را آغاز کرد

24 آذر 1404 - به‌روزشده در 25 آذر 1404
نمای نزدیک از ساعت هوشمند Huawei Watch نسخه دهمین سالگرد با بدنه فلزی، تاج چرخان و صفحه نمایش دایره‌ای حاوی ویجت‌ های سلامت و زمان، تمرکز بر طراحی پریمیوم و رابط کاربری پیشرفته

هواوی نسخه دهمین سالگرد هواوی واچ را هم‌زمان با نوا ۱۵ معرفی می‌کند

26 آذر 1404
تصویر یک تولیدکننده محتوای نگران را نشان می‌دهد که مقابل مانیتور با نمودار درآمد در حال سقوط و لوگوی یوتیوب نشسته است و کاهش شدید درآمد تبلیغاتی را به‌صورت نمادین نمایش می‌دهد.

زلزله در یوتیوب فارسی؛ سقوط ۹۰ درصدی درآمد تولیدکنندگان محتوا

26 آذر 1404
پوستر تبلیغاتی ساعت Rogbid در طبیعت که قابلیت چراغ‌قوه جانبی و مسیریابی روی صفحه آن فعال است.

ساعت هوشمند راگبید Enduro با باتری ۱۱۰۰ میلی‌آمپر ساعتی عرضه شد

24 آذر 1404 - به‌روزشده در 25 آذر 1404
اپل برای عرضه هشت آیفون جدید آماده می‌ شود

اپل برای عرضه هشت آیفون جدید آماده می‌ شود

26 آذر 1404
Technoc

دنیا با سرعتی خیره کننده به سمت تحقق رویاهایی می رود که تا دیروز دست نیافتنی و محال بود و بشر با گذر از دریایی از موانع یک به یک در حال تحقق آنها است.

ما در” تک ناک” تلاش می کنیم سهمی از انعکاس تحولات بی شمار فناوری و اخبار تکنولوژی داشته باشیم و در این کهکشان بی انتهای یافته های علمی و دانش محور محتوایی قابل اتکاء و اخباری موثق را از گوشه و کنار دنیا در اختیار علاقمندان و مخاطبان خود قرار دهیم.

ما را در شبکه های اجتماعی دنبال کنید

تازه‌ها

نیچر شاخص‌ترین تصاویر علمی سال ۲۰۲۵ را منتشر کرد؛ از اعماق فضا تا زیست‌پزشکی و بحران اقلیم.

نیچر برترین تصاویر علمی سال ۲۰۲۵ را منتشر کرد

27 آذر 1404
Gemini با Nano Banana و تشخیص SynthID

افزایش قابلیت‌های اپلیکیشن جمنای

27 آذر 1404
مادربرد Mini-ITX با چهار اسلات رم سایز بزرگ

Maxsun مرزهای Mini-ITX را جابه‌جا کرد؛ چهار اسلات رم فول‌سایز روی یک برد کوچک

27 آذر 1404
ویندوز سرور 2025 با پشتیبانی بومی NVMe

پشتیبانی بومی NVMe در ویندوز سرور ۲۰۲۵: انقلابی در عملکرد I/O و کاهش مصرف CPU

27 آذر 1404

دسترسی سریع

  • فناوری
  • کامپیوتر و موبایل
  • نقد و بررسی
  • آموزش
  • ارز دیجیتال
  • علمی
  • کسب و کار
  • وسائل نقلیه
  • بازی و سرگرمی
  • چند رسانه ای
  • صفحه اصلی
  • همه اخبار
  • تبلیغات تکناک
  • درباره ما
  • تماس با ما

© Copyright 2025 Technoc.ir

No Result
مشاهده تمامی نتایج
  • فناوری
    • اخبار هوش مصنوعی
    • رباتیک
    • اینترنت و شبکه
    • شبکه های اجتماعی
    • هوافضا
    • معماری
    • ورزش
    • رویداد ها
    • دوربین دیجیتال
  • کامپیوتر و موبایل
    • موبایل و تبلت
    • لپ تاپ و کامپیوتر
    • اپلیکیشن موبایل
    • نرم افزار
    • سخت افزار
    • ساعت هوشمند
    • مانیتور
    • اسپیکر و هدفون
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
  • نقد و بررسی
    • بررسی موبایل و تبلت
    • کنسول بازی
    • بررسی لپ تاپ و کامپیوتر
    • قطعات کامپیوتر
    • نرم افزار
    • بررسی اسپیکر و هدفون
    • بررسی ساعت هوشمند
  • آموزش
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
    • آموزش هوش مصنوعی
    • سخت افزار
  • اخبار ارز دیجیتال
    • قیمت لحظه ای ارز دیجیتال
    • ماشین حساب ارز دیجیتال
    • آموزش ارز دیجیتال
  • علمی
    • سلامت و پزشکی
    • انرژی
    • فیزیک
    • شیمی
    • نجوم
    • ورزش
    • محیط زیست
    • باستان شناسی
  • کسب و کار
    • شرکت ها
    • بورس
    • مدیریت(پروژه، کسب و کار، منابع انسانی)
    • استارتاپ ها
    • دولت الکترونیک
    • رویداد کسب و کار
  • وسائل نقلیه
    • خودرو
    • دوچرخه
    • موتور سیکلت
    • قطار
    • هواپیما
  • بازی و سرگرمی
    • کنسول بازی های کامپیوتری
    • بازی های کامپیوتر
    • بازی کنسول
    • بازی موبایل
    • فیلم و سریال
  • چند رسانه ای
    • عکس
    • ویدئو
  • اخبار داخلی
    • دانش بنیان
    • دولت الکترونیک
    • رویداد داخلی
    • بازار
    • دانشگاه

© Copyright 2025 Technoc.ir