• صفحه اصلی
  • همه اخبار
  • تبلیغات تکناک
  • درباره ما
  • تماس با ما
اخبار تکنولوژی روز جهان و ایران
  • فناوری
    • اخبار هوش مصنوعی
    • رباتیک
    • اینترنت و شبکه
    • شبکه های اجتماعی
    • هوافضا
    • معماری
    • ورزش
    • رویداد ها
    • دوربین دیجیتال
  • کامپیوتر و موبایل
    • موبایل و تبلت
    • لپ تاپ و کامپیوتر
    • اپلیکیشن موبایل
    • نرم افزار
    • سخت افزار
    • ساعت هوشمند
    • مانیتور
    • اسپیکر و هدفون
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
  • نقد و بررسی
    • بررسی موبایل و تبلت
    • کنسول بازی
    • بررسی لپ تاپ و کامپیوتر
    • قطعات کامپیوتر
    • نرم افزار
    • بررسی اسپیکر و هدفون
    • بررسی ساعت هوشمند
  • آموزش
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
    • آموزش هوش مصنوعی
    • سخت افزار
  • اخبار ارز دیجیتال
    • قیمت لحظه ای ارز دیجیتال
    • ماشین حساب ارز دیجیتال
    • آموزش ارز دیجیتال
  • علمی
    • سلامت و پزشکی
    • انرژی
    • فیزیک
    • شیمی
    • نجوم
    • ورزش
    • محیط زیست
    • باستان شناسی
  • کسب و کار
    • شرکت ها
    • بورس
    • مدیریت(پروژه، کسب و کار، منابع انسانی)
    • استارتاپ ها
    • دولت الکترونیک
    • رویداد کسب و کار
  • وسائل نقلیه
    • خودرو
    • دوچرخه
    • موتور سیکلت
    • قطار
    • هواپیما
  • بازی و سرگرمی
    • کنسول بازی های کامپیوتری
    • بازی های کامپیوتر
    • بازی کنسول
    • بازی موبایل
    • فیلم و سریال
  • چند رسانه ای
    • عکس
    • ویدئو
  • اخبار داخلی
    • دانش بنیان
    • دولت الکترونیک
    • رویداد داخلی
    • بازار
    • دانشگاه
No Result
مشاهده تمامی نتایج
اخبار تکنولوژی روز جهان و ایران
  • فناوری
    • اخبار هوش مصنوعی
    • رباتیک
    • اینترنت و شبکه
    • شبکه های اجتماعی
    • هوافضا
    • معماری
    • ورزش
    • رویداد ها
    • دوربین دیجیتال
  • کامپیوتر و موبایل
    • موبایل و تبلت
    • لپ تاپ و کامپیوتر
    • اپلیکیشن موبایل
    • نرم افزار
    • سخت افزار
    • ساعت هوشمند
    • مانیتور
    • اسپیکر و هدفون
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
  • نقد و بررسی
    • بررسی موبایل و تبلت
    • کنسول بازی
    • بررسی لپ تاپ و کامپیوتر
    • قطعات کامپیوتر
    • نرم افزار
    • بررسی اسپیکر و هدفون
    • بررسی ساعت هوشمند
  • آموزش
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
    • آموزش هوش مصنوعی
    • سخت افزار
  • اخبار ارز دیجیتال
    • قیمت لحظه ای ارز دیجیتال
    • ماشین حساب ارز دیجیتال
    • آموزش ارز دیجیتال
  • علمی
    • سلامت و پزشکی
    • انرژی
    • فیزیک
    • شیمی
    • نجوم
    • ورزش
    • محیط زیست
    • باستان شناسی
  • کسب و کار
    • شرکت ها
    • بورس
    • مدیریت(پروژه، کسب و کار، منابع انسانی)
    • استارتاپ ها
    • دولت الکترونیک
    • رویداد کسب و کار
  • وسائل نقلیه
    • خودرو
    • دوچرخه
    • موتور سیکلت
    • قطار
    • هواپیما
  • بازی و سرگرمی
    • کنسول بازی های کامپیوتری
    • بازی های کامپیوتر
    • بازی کنسول
    • بازی موبایل
    • فیلم و سریال
  • چند رسانه ای
    • عکس
    • ویدئو
  • اخبار داخلی
    • دانش بنیان
    • دولت الکترونیک
    • رویداد داخلی
    • بازار
    • دانشگاه
No Result
مشاهده تمامی نتایج
اخبار تکنولوژی روز جهان و ایران

تک ناک » فناوری » جنجال بر سر بنچمارک‌های Grok 3؛ آیا xAI واقعیت را تحریف کرده است؟

جنجال بر سر بنچمارک‌های Grok 3؛ آیا xAI واقعیت را تحریف کرده است؟

سید محمد برازنده نوشته شده توسط سید محمد برازنده
یکشنبه 5 اسفند 1403 - 15:00
در اخبار هوش مصنوعی, فناوری
جنجال بر سر بنچمارک‌های Grok 3؛ آیا xAI واقعیت را تحریف کرده است؟
کپی لینکاشتراک گذاری در تلگراماشتراک گذاری در توییتر

شرکت OpenAI، استارت‌آپ xAi متعلق به ایلان ماسک را به گمراه کردن مخاطبان در ارائه بنچمارک‌های مربوط به هوش مصنوعی Grok 3 متهم کرد.

به گزارش تک‌ناک، ایگور بابوشکین، یکی از هم‌بنیان‌گذاران xAI، این اتهام را رد و از صحت عملکرد شرکت خود دفاع کرده است. بحث‌ها پیرامون بنچمارک‌های هوش مصنوعی و نحوه ارائه آنها توسط شرکت‌های فعال در این حوزه، اکنون به فضای عمومی کشیده شده است.

استارت‌آپ xAI در وبلاگ رسمی خود نموداری منتشر کرد که عملکرد Grok 3 را در آزمون ریاضی AIME 2025 به نمایش می‌گذاشت. برخی متخصصان، اعتبار این آزمون را به‌ عنوان یک معیار سنجش هوش مصنوعی زیر سؤال برده‌اند، با وجود این‌، AIME 2025 و نسخه‌های پیشین آن اغلب برای ارزیابی توانایی ریاضی مدل‌ها به کار می‌روند.

جنجال بر سر بنچمارک‌های هوش مصنوعی Grok 3

بر اساس این نمودار و نتایج بنچمارک‌ها، دو نسخه از Grok 3، یعنی Grok 3 Reasoning Beta و Grok 3 mini Reasoning، موفق شده‌اند مدل o3-mini-high، که بهترین مدل موجود OpenAI است را در آزمون AIME 2025 شکست دهند. اما کارکنان OpenAI در X به سرعت واکنش نشان دادند و تأکید کردند که این نمودار، امتیاز مدل o3-mini-high را در معیار “cons@64” لحاظ نکرده است.

اما “cons@64” چیست؟ این معیار که مخفف “consensus@64” است، به مدل اجازه می‌دهد 64 بار به هر سؤال پاسخ دهد و در نهایت، پرتکرارترین پاسخ را به‌ عنوان جواب نهایی در نظر می‌گیرد. این روش اغلب باعث افزایش چشمگیر امتیاز مدل‌ها در بنچمارک‌ها می‌شود. حذف این معیار از نمودار می‌تواند این تصور را ایجاد کند که یک مدل از مدل دیگر برتر است، در حالی‌ که در عمل اینگونه نیست.

در معیار “@1” – که نشان‌دهنده امتیاز اولیه مدل‌ها در اولین تلاش است – امتیازات Grok 3 Reasoning Beta و Grok 3 mini Reasoning کمتر از امتیاز o3-mini-high است. علاوه بر این، Grok 3 Reasoning Beta حتی اندکی پایین‌تر از مدل o1 شرکت OpenAI با تنظیمات “medium” قرار می‌گیرد. با وجود این‌، xAI همچنان Grok 3 را به‌ عنوان «باهوش‌ترین هوش مصنوعی جهان» معرفی کرده است.

بابوشکین در X استدلال کرد که OpenAI نیز در گذشته نمودارهای مشابهی منتشر کرده است، هرچند که این نمودارها مربوط به مقایسه مدل‌های خود شرکت بوده‌اند. در همین حال، یک تحلیلگر مستقل نموداری دقیق‌تر منتشر کرده است، که عملکرد تمامی مدل‌ها را در معیار cons@64 نشان می‌دهد.

با وجود این‌، همان‌طور که ناتان لمبرت، محقق هوش مصنوعی اشاره کرده است، شاید مهم‌ترین عامل همچنان نامشخص باشد، اینکه هزینه محاسباتی و مالی هر مدل برای رسیدن به بهترین امتیاز در چه حدی بوده است.

این موضوع نشان می‌دهد که بنچمارک‌های هوش مصنوعی تنها بخش کوچکی از تصویر کلی را نمایش می‌دهند و اطلاعات کاملی درباره محدودیت‌ها و نقاط قوت مدل‌ها ارائه نمی‌کنند.

سید محمد برازنده

سید محمد برازنده

کارشناسی مترجمی زبان فرانسه. از سال 87 تاکنون در حوزه های مختلف سابقه ترجمه دارم. بیش از یک سال هست که مترجم حوزه فناوری تو سایت تک ناک هستم.

مطالب مرتبط

چین نخستین تراشه مغزی تجاری جهان را عرضه کرد
فناوری

چین نخستین تراشه مغزی تجاری جهان را عرضه کرد

نوشته شده توسط نرگس چالوک
25 خرداد 1405
تصویر ترکیبی که در سمت راست کی‌یر استارمر (Keir Starmer) در حال سخنرانی پشت تریبون دیده می‌شود و در سمت چپ، گوشی آیفونی در دست یک فرد قرار دارد که پوشه Social Media شامل اپلیکیشن‌های اینستاگرام، تیک‌تاک، ایکس (توییتر سابق) و بلواسکای روی نمایشگر آن باز است
شبکه های اجتماعی

بریتانیا شبکه‌‌های اجتماعی را برای کودکان زیر ۱۶ سال ممنوع می‌‌کند

نوشته شده توسط تارخ ترهنده
25 خرداد 1405
اپل برای جبران هزینه‌‌های هوش مصنوعی نسخه اشتراکی سیری را معرفی می‌ کند
اخبار هوش مصنوعی

اپل برای جبران هزینه‌‌های هوش مصنوعی نسخه اشتراکی سیری را معرفی می‌ کند

نوشته شده توسط تارخ ترهنده
25 خرداد 1405
چین نقطه‌ ضعف خطرناک ماه‌نشین ناسا را فاش کرد
فناوری

چین نقطه‌ ضعف خطرناک ماه‌نشین ناسا را فاش کرد

نوشته شده توسط نرگس چالوک
25 خرداد 1405
پگاسوس؛ ماه‌نورد پیشرفته‌ای که آینده سکونت انسان در ماه را رقم می‌ زند
فناوری

پگاسوس؛ ماه‌نورد پیشرفته‌ای که آینده سکونت انسان در ماه را رقم می‌ زند

نوشته شده توسط نرگس چالوک
25 خرداد 1405
خبر بعدی
رونمایی از مانیتور گیمینگ 520 هرتزی XG2737 ویوسونیک

رونمایی از مانیتور گیمینگ 520 هرتزی XG2737 ویوسونیک

دیدگاهتان را بنویسید لغو پاسخ

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

آذرآنلاین آذرآنلاین آذرآنلاین

پیشنهادی

سامسونگ به‌روزرسانی رابط کاربری One UI 8.5 را منتشر کرد

سامسونگ به‌روزرسانی رابط کاربری One UI 8.5 را منتشر کرد

24 خرداد 1405
آنر از گوشی میان‌رده 600e خود رونمایی کرد

آنر از گوشی میان‌رده 600e خود رونمایی کرد + تصویر

5 خرداد 1405

داغ‌ترین‌های روز

مقایسه F-35 و Su-57؛ کدام جنگنده نسل پنجم برتری دارد؟

مقایسه F-35 و Su-57؛ کدام جنگنده نسل پنجم برتری دارد؟

22 خرداد 1405 - به‌روزشده در 23 خرداد 1405
انواع تیپ های سورن پلاس

معرفی انواع تیپ های سورن پلاس ؛ کدام مدل خودرو ارزش خرید بالاتری دارد؟

22 خرداد 1405 - به‌روزشده در 23 خرداد 1405
نصب موتور Pratt & Whitney F135 روی نخستین جنگنده رادارگریز F-35A آلمان در خط مونتاژ نهایی شرکت Lockheed Martin

نخستین جنگنده F-35A آلمان وارد مرحله نهایی تولید شد

16 خرداد 1405 - به‌روزشده در 17 خرداد 1405
نخستین جنگنده دوکابینه Gripen F جهان رونمایی شد

نخستین جنگنده دوکابینه Gripen F جهان رونمایی شد

19 خرداد 1405 - به‌روزشده در 20 خرداد 1405
ساعت گلکسی واچ با باتری بزرگتر

ساعت Galaxy Watch Ultra 2 با باتری بزرگتر به بازار می آید

24 خرداد 1405 - به‌روزشده در 25 خرداد 1405
Technoc

دنیا با سرعتی خیره کننده به سمت تحقق رویاهایی می رود که تا دیروز دست نیافتنی و محال بود و بشر با گذر از دریایی از موانع یک به یک در حال تحقق آنها است.

ما در” تک ناک” تلاش می کنیم سهمی از انعکاس تحولات بی شمار فناوری و اخبار تکنولوژی داشته باشیم و در این کهکشان بی انتهای یافته های علمی و دانش محور محتوایی قابل اتکاء و اخباری موثق را از گوشه و کنار دنیا در اختیار علاقمندان و مخاطبان خود قرار دهیم.

ما را در شبکه های اجتماعی دنبال کنید

تازه‌ها

شوک توافق به بازارها؛ طلا، سکه و دلار در مسیر عقب‌نشینی

شوک توافق به بازارها؛ طلا، سکه و دلار در مسیر عقب‌نشینی

25 خرداد 1405
چین نخستین تراشه مغزی تجاری جهان را عرضه کرد

چین نخستین تراشه مغزی تجاری جهان را عرضه کرد

25 خرداد 1405
این آویز هوشمند از پوست شما مراقبت می کند

این آویز هوشمند از پوست شما مراقبت می کند

25 خرداد 1405
بزرگ‌ترین موج توقف پشتیبانی نرم‌افزاری دستگاه‌های اپل در پاییز رخ می‌ دهد

بزرگ‌ترین موج توقف پشتیبانی نرم‌افزاری دستگاه‌های اپل در پاییز رخ می‌ دهد

25 خرداد 1405

دسترسی سریع

  • فناوری
  • کامپیوتر و موبایل
  • نقد و بررسی
  • آموزش
  • ارز دیجیتال
  • علمی
  • کسب و کار
  • وسائل نقلیه
  • بازی و سرگرمی
  • چند رسانه ای
  • صفحه اصلی
  • همه اخبار
  • تبلیغات تکناک
  • درباره ما
  • تماس با ما

© Copyright 2025 Technoc.ir

No Result
مشاهده تمامی نتایج
  • فناوری
    • اخبار هوش مصنوعی
    • رباتیک
    • اینترنت و شبکه
    • شبکه های اجتماعی
    • هوافضا
    • معماری
    • ورزش
    • رویداد ها
    • دوربین دیجیتال
  • کامپیوتر و موبایل
    • موبایل و تبلت
    • لپ تاپ و کامپیوتر
    • اپلیکیشن موبایل
    • نرم افزار
    • سخت افزار
    • ساعت هوشمند
    • مانیتور
    • اسپیکر و هدفون
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
  • نقد و بررسی
    • بررسی موبایل و تبلت
    • کنسول بازی
    • بررسی لپ تاپ و کامپیوتر
    • قطعات کامپیوتر
    • نرم افزار
    • بررسی اسپیکر و هدفون
    • بررسی ساعت هوشمند
  • آموزش
    • سیستم عامل موبایل
    • سیستم عامل کامپیوتر
    • آموزش هوش مصنوعی
    • سخت افزار
  • اخبار ارز دیجیتال
    • قیمت لحظه ای ارز دیجیتال
    • ماشین حساب ارز دیجیتال
    • آموزش ارز دیجیتال
  • علمی
    • سلامت و پزشکی
    • انرژی
    • فیزیک
    • شیمی
    • نجوم
    • ورزش
    • محیط زیست
    • باستان شناسی
  • کسب و کار
    • شرکت ها
    • بورس
    • مدیریت(پروژه، کسب و کار، منابع انسانی)
    • استارتاپ ها
    • دولت الکترونیک
    • رویداد کسب و کار
  • وسائل نقلیه
    • خودرو
    • دوچرخه
    • موتور سیکلت
    • قطار
    • هواپیما
  • بازی و سرگرمی
    • کنسول بازی های کامپیوتری
    • بازی های کامپیوتر
    • بازی کنسول
    • بازی موبایل
    • فیلم و سریال
  • چند رسانه ای
    • عکس
    • ویدئو
  • اخبار داخلی
    • دانش بنیان
    • دولت الکترونیک
    • رویداد داخلی
    • بازار
    • دانشگاه

© Copyright 2025 Technoc.ir