فهرست مطالب
اسناد تازه پرونده نیویورکتایمز نشان میدهد مدیران مایکروسافت و OpenAI درباره آموزش مدلهای هوش مصنوعی و تهدید آن برای رسانه هشدار دادهاند.
به گزارش سرویس هوش مصنوعی تکناک،اسناد تازه منتشرشده از پرونده حقوقی نیویورکتایمز علیه OpenAI و مایکروسافت نشان میدهد برخی مدیران این شرکتها در مکاتبات داخلی، استفاده گسترده از محتوای ناشران برای آموزش هوش مصنوعی را با واژههایی مانند «سرقت» توصیف کردهاند و درباره تهدید احتمالی محصولات هوش مصنوعی به صنعت رسانه هشدار دادهاند. این اطلاعات در ادامه پروندهای منتشر شده است که نیویورکتایمز سه سال پیش علیه OpenAI و مایکروسافت مطرح کرد.
این رسانه مدعی است دو شرکت بدون دریافت مجوز، از حجم گستردهای از محتوای دارای حق نشر برای آموزش مدلهای هوش مصنوعی مولد استفاده کردهاند. بخش زیادی از اطلاعات جدید از متن حقوقی نیویورکتایمز به دست آمده است و اسناد اصلی مرتبط با برخی نقلقولها همچنان محرمانه باقی ماندهاند. به همین دلیل، شماری از اظهارات منتشرشده بدون زمینه کامل مکاتبات داخلی ارائه شدهاند.
بیشتر بخوانید: منشی هوشمند صوتی شرکت ElevenLabs رونمایی شد
نگرانی مدیران درباره آسیب هوش مصنوعی به رسانهها
یکی از مهمترین بخشهای اسناد جدید به اظهارات داخلی مدیران مایکروسافت و OpenAI درباره تاثیر محصولات هوش مصنوعی بر ناشران مربوط میشود. برنت هچت، مدیر علوم کاربردی مایکروسافت، در یک یادداشت داخلی در ژانویه ۲۰۲۳، جمعآوری گسترده محتوا برای آموزش مدلها را «سرقتی شگفتانگیز با ابعادی بیسابقه» توصیف کرد. او همچنین این فرایند را «بزرگترین سرقت نیروی کار در تاریخ بشر» نامید.

برای مطالعه بیشتر: شرکت OpenAI دستیار هوشمند اختصاصی برای وکلا معرفی کرد
اسناد داخلی مایکروسافت همچنین نشان میدهند این شرکت درباره پیامدهای اقتصادی سیستمهای هوش مصنوعی برای تولیدکنندگان محتوا نگرانی داشته است. یکی از اسناد هشدار داده که هوش مصنوعی مولد ممکن است اشتغال همان افرادی را مختل کند که دادههای مورد استفاده برای آموزش مدلهای پایه را تولید کردهاند.
نیک تورلی، مدیر ChatGPT در OpenAI، نیز در مکاتبات داخلی نوشته است که ناشران با «تهدیدی وجودی» از سوی محصولاتی مانند چتباتها روبهرو هستند. او این محصولات را تا حد زیادی «جایگزینکننده» توصیف کرده و گفته است با بهتر شدن آنها، میزان جایگزینی نیز افزایش پیدا میکند. گرگ براکمن، رئیس OpenAI، نیز در یکی از مکاتبات داخلی گفته است مدلهای این شرکت در حوزه اخبار عملکرد بسیار خوبی دارند.
کاهش شدید کلیک کاربران روی نیویورکتایمز
یکی از مهمترین دادههای مطرحشده در پرونده به تاثیر سیستمهای پاسخگویی هوش مصنوعی بر ترافیک ناشران مربوط میشود. طبق دادههای داخلی مایکروسافت، موتور پاسخگویی کوپایلت باعث شده نرخ کلیک کاربران روی دامنه نیویورکتایمز در مقایسه با جستوجوی سنتی Bing تا ۹۳ درصد کاهش پیدا کند. هچت در یک ارائه داخلی در ژانویه ۲۰۲۴ این وضعیت را یک «چرخه نابودی» توصیف کرده است. او هشدار داده که کاهش ترافیک سایتهای تولیدکننده محتوا میتواند در نهایت هم به آموزش مدلهای هوش مصنوعی و هم به کل اکوسیستم وب آسیب بزند.
در یکی از اسناد مایکروسافت آمده است که معمول نیست یک محصول نهایی پایههای اقتصادی تامینکنندگان اصلی خود را تهدید کند، اما کسبوکار مدلهای زبانی بزرگ مایکروسافت در رابطه با زنجیره تامین محتوا در چنین شرایطی قرار گرفته است. ساتیا نادلا، مدیرعامل مایکروسافت، نیز در جلسه بازجویی قضایی خود گفته است هر محتوایی که پشت دیوار پرداخت قرار دارد باید برای استفاده در آموزش یا تغذیه سیستمهای هوش مصنوعی مجوز دریافت کند.
نادلا همچنین گفته است اگر از این موضوع مطلع میشد که OpenAI محتوای پشت دیوار پرداخت را جمعآوری و برای آموزش مدلها استفاده کرده، میتوانست از حق مایکروسافت برای درخواست آموزش مجدد مدلهای هوش مصنوعی استفاده کند. او همچنین پذیرفته است که دریافت پاسخ مستقیم از یک چتبات میتواند جای مراجعه کاربر به وبسایت اصلی را بگیرد.
میلیونها سند خبری در مجموعه دادههای آموزشی مدلهای هوش مصنوعی
اسناد جدید جزئیات بیشتری از حجم محتوای خبری مورد استفاده در آموزش مدلهای OpenAI ارائه میکنند.طبق این پرونده، مجموعه دادههای مربوط به مرحله میانی آموزش مدلهای OpenAI شامل بیش از ۹۱ هزار و ۶۹۲ نسخه از آثار منتشرشده توسط نیویورکتایمز، Daily News و Center for Investigative Reporting بوده است. یک مجموعه داده مبتنی بر Common Crawl نیز بیش از ۲ میلیون سند از دامنه nytimes.com را در خود داشته است.
Common Crawl یک مخزن عمومی از دادههای جمعآوریشده از وب است و شرکتها و پژوهشگران میتوانند از دادههای آن برای ساخت مجموعههای آموزشی مدلهای هوش مصنوعی استفاده کنند. در بخش دیگری از پرونده آمده است OpenAI کل مجموعه داده آموزشی GPT-3 را در اختیار مایکروسافت قرار داده بود. مایکروسافت نیز از این دادهها برای بررسی نحوه استفاده از مدلهای OpenAI در محصولات تجاری خود استفاده کرد.

حتما بخوانید: Grok با دادههای استارتاپهای ورشکسته آموزش میبیند
مایکروسافت نیز از طریق پروژههایی با نام Project Taxi و Project Mango دادههایی را در اختیار OpenAI قرار داده است. طبق ادعای مطرحشده در پرونده، مجموعه داده Project Mango شامل نسخههایی از دستکم ۱۶۰ هزار و ۹۰۳ اثر منحصربهفرد متعلق به ناشران خبری بوده است. این پرونده همچنین ادعا میکند OpenAI مجموعه دادههایی مانند WebText و WebText2 را ایجاد کرده که سهم قابل توجهی از محتوای آنها از مطالب خبری استخراجشده از وب تشکیل شده است.
استفاده از آثار دارای حق نشر برای آموزش مدلهای هوش مصنوعی
یکی دیگر از بخشهای مهم پرونده به روشهای دسترسی OpenAI به محتوای ناشران مربوط میشود.طبق اسناد منتشرشده، برخی کارکنان OpenAI راههایی برای عبور از دیوارهای پرداخت بدون شناسایی پیدا کرده بودند. در یکی از مکاتبات، نیک رایدر، پژوهشگر OpenAI، به گرگ براکمن درباره یک «هک برای عبور از دیوار پرداخت نیویورکتایمز» اطلاع داده است. براکمن نیز در پاسخ نوشته است: «آه، خوبه.» در این پرونده همچنین ادعا شده است OpenAI و مایکروسافت بخشی از محتوای ناشران را از شاخص جستوجوی بینگ دریافت کردهاند.
اسناد همچنین به حذف اطلاعات مربوط به مالکیت معنوی از برخی دادههای آموزشی اشاره میکنند. طبق ادعای مطرحشده، پژوهشگران اطلاعات کپیرایت را از مجموعه دادهها حذف میکردند زیرا نمیخواستند مدلها این اعلانها را در خروجی خود به کاربران نمایش دهند. موضوع استفاده از آثار دارای حق نشر برای آموزش هوش مصنوعی همچنان یکی از اصلیترین اختلافهای حقوقی صنعت هوش مصنوعی است.
شرکتهای فعال در این حوزه معمولا استدلال میکنند که آموزش مدلها میتواند در چارچوب «استفاده منصفانه» قرار بگیرد. در مقابل، ناشران و صاحبان محتوا استدلال میکنند که مدلهای هوش مصنوعی از آثار آنها برای تولید محصولاتی استفاده میکنند که در برخی موارد با محتوای اصلی رقابت دارند و میتوانند ترافیک و درآمد آنها را کاهش دهند. استیون لیبرمن، وکیل نیویورک دیلی نیوز، گفته است شواهد جدید نشان میدهد OpenAI و مایکروسافت از ماهیت اقدام خود آگاه بودهاند.

















