فهرست مطالب
شرکت OpenAI مدل هوش مصنوعی تولید تصویر ChatGPT Images 2.5 را با قابلیت تولید تصاویر با کیفیت بالاتر، امکان ویرایش دقیقتر و سرعت تولید تصویر بیشتر منتشر کرد.
به گزارش سرویس هوش مصنوعی تکناک، کاربران ChatGPT هر هفته بیش از ۳ میلیارد تصویر را با ChatGPT Images و مدلهای GPT-Image در API تولید میکنند و نسل جدید این فناوری با هدف بهبود کیفیت خروجی و افزایش کنترل کاربران بر فرایند تولید و ویرایش تصاویر توسعه یافته است.
تصاویر تولید شده با ChatGPT Images 2.5 از نورپردازی طبیعیتر و بافتهای غنیتری برخوردار است و این مدل جدید در حفظ ویژگیهای سوژههای موجود در تصاویر مرجع عملکرد دقیقتری دارد. همچنین این مدل دستورهای ویرایشی را در چند مرحله بهتر دنبال میکند و احتمال تغییر ناخواسته بخشهایی از تصویر را کاهش میدهد.
شرکت OpenAI زمان تأخیر تولید تصویر را در Images 2.5 در مقایسه با Images 2.0 تا ۵۰ درصد کاهش داده است. این تغییر به کاربران اجازه میدهد تصاویر جدید را سریعتر تولید کنند و در زمان کوتاهتری نسخههای مختلف یک ایده را بسازند یا جزئیات آن را اصلاح کنند.
این شرکت در کنار مدل جدید، چند قابلیت تازه را نیز به ChatGPT اضافه کرده است تا کاربران کنترل بیشتری بر فرایند خلاقانه داشته باشند. قابلیت Sketch یکی از مهمترین ابزارهای جدید است و امکان طراحی مستقیم یک طرح اولیه در ChatGPT را فراهم میکند.
بیشتر بخوانید: شرکت OpenAI مدعی حل یکی از دشوارترین مسائل ریاضی شد
حفظ بهتر سوژهها با مدل ChatGPT Images 2.5
یکی از مهمترین تغییرات Images 2.5 به توانایی مدل در استفاده از تصاویر مرجع مربوط میشود. شرکت OpenAI بیان کرد که مدل جدید میتواند ویژگیهای سوژههای واقعی را در تغییر سبک، محیط یا ترکیببندی بهتر حفظ کند.
این قابلیت بهویژه زمانی اهمیت دارد که کاربر بخواهد یک فرد، شیء یا مکان مشخص را در موقعیت یا سبک بصری تازهای بازسازی کند. در نسل جدید، سوژه نهایی شباهت بیشتری به تصویر مرجع دارد و جزئیات متمایز آن با احتمال بیشتری در خروجی نهایی باقی میمانند.
نورپردازی و بافتها نیز در Images 2.5 طبیعیتر شدهاند. به گفته OpenAI، مدل جدید میتواند صحنههایی تولید کند که ارتباط بصری بیشتری با تصاویر واقعی دارند و در عین حال سبک یا فضای تازهای را که کاربر درخواست کرده است، حفظ میکنند.
این ویژگی برای توسعهدهندگانی که از Images API استفاده میکنند نیز کاربرد زیادی دارد. تیمهایی که چند نسخه مختلف از یک تصویر مرجع تولید میکنند، میتوانند خروجیهایی هماهنگتر با منبع اصلی دریافت کنند و کمتر با تغییر ناخواسته ویژگیهای اصلی سوژه مواجه شوند.
ویرایش دقیقتر مدل ChatGPT Images 2.5
شرکت OpenAI در Images 2.5 تمرکز ویژهای بر ویرایش هدفمند تصاویر داشته است. مدل جدید تلاش میکند فقط همان بخشی را تغییر دهد که کاربر در دستور خود مشخص کرده است و سایر عناصر تصویر را بدون تغییر نگه دارد.
در نسخههای قبلی، یک ویرایش ساده گاهی میتوانست به تغییر ترکیببندی، ظاهر سوژه یا جزئیات پسزمینه منجر شود. مدل Images 2.5 برای کاهش این مشکل طراحی شده است و میتواند حتی در تصاویر پیچیده با چند سوژه یا پسزمینههای پرجزئیات، بخش مورد نظر را دقیقتر اصلاح کند.
این قابلیت برای کاربردهای حرفهای اهمیت بیشتری دارد. یک طراح میتواند فقط محصول را در یک تصویر تبلیغاتی تغییر دهد، بدون اینکه نورپردازی، ترکیببندی یا ظاهر سایر بخشها دستخوش تغییر شود.
توسعهدهندگان نیز میتوانند یک عنصر مشخص مانند پسزمینه، محصول یا بخشی از متن را در Images API اصلاح کنند و در عین حال هویت بصری اصلی تصویر را حفظ کنند.
شرکت OpenAI اعلام کرده است که مدل جدید در ویرایشهای چندمرحلهای نیز ثبات بیشتری دارد. اگر کاربر در چند مرحله مختلف تغییراتی را روی یک تصویر اعمال کند، Images 2.5 بهتر میتواند تغییرات قبلی را حفظ کند.
به این ترتیب، هر دستور جدید روی نتیجه قبلی اعمال میشود و احتمال کاهش تدریجی کیفیت یا از بین رفتن اصلاحات مراحل قبلی کمتر خواهد بود. این موضوع میتواند در پروژههای طولانی که یک تصویر بارها ویرایش میشود، اهمیت زیادی داشته باشد.
بیشتر بخوانید: ابزار ChatGPT Sites از راه رسید؛ ساخت و انتشار سایت فقط با دستور متنی
درک بهتر دستورهای پیچیده و سبکهای بصری
مدل ChatGPT Images 2.5 در درک دستورهای تصویری پیچیده نیز پیشرفت کرده است. شرکت OpenAI بیان کرده است که این مدل میتواند دستورهایی با چند جزئیات بصری را بهتر تحلیل کند و نتیجهای منسجمتر ارائه دهد.
این مدل در تولید تصاویر شامل اطلاعات دنیای واقعی نیز عملکرد دقیقتری دارد و میتواند ساختارهای تصویری پیچیدهتر را مدیریت کند. پشتیبانی بهتر از پسزمینههای شفاف یکی دیگر از قابلیتهایی است که OpenAI برای مدل جدید مطرح کرده است.
همچنین مدل جدید در بازآفرینی سبکهای هنری و بصری پیشرفت کرده است. کاربران میتوانند سبک مورد نظر خود را با جزئیات بیشتری توصیف کنند و احتمال بیشتری وجود دارد که خروجی نهایی به همان جهت هنری نزدیک بماند.
این موضوع برای تیمهای خلاق و کسبوکارها نیز کاربرد دارد. مجموعهای از تصاویر تبلیغاتی باید معمولا ترکیببندی، سبک، هویت بصری و جزئیات مشخصی را در چند خروجی مختلف حفظ کند.
شرکت OpenAI گفته است که Images 2.5 در چنین پروژههایی کمتر از دستور اصلی منحرف میشود و میتواند در تولید مجموعه تصاویر هماهنگ با برند، طرحهای رابط کاربری و تصاویر ارائهها عملکرد قابل اعتمادتری داشته باشد.
Sketch و قالبهای آماده وارد ChatGPT شدند
قابلیت Sketch یکی از ابزارهای جدیدی است که همراه مدل ChatGPT Images 2.5 معرفی شده است. این قابلیت به کاربران اجازه میدهد یک طرح ساده را مستقیما در ChatGPT بکشند و از آن به عنوان راهنمای بصری برای تولید تصویر نهایی استفاده کنند.
کاربر میتواند چیدمان یک اتاق، فرم یک لباس یا حتی یک طرح ساده را ترسیم کند و سپس از ChatGPT بخواهد آن را به تصویری کامل تبدیل کند.
امکان افزودن توضیحات درباره سبک، رنگ، نورپردازی و سایر جزئیات نیز وجود دارد. به این ترتیب، طرح اولیه نقش ساختار پایه را ایفا میکند و توضیحات متنی، ظاهر نهایی تصویر را مشخص میکنند.
شرکت OpenAI تأکید کرده است که کاربران برای استفاده از Sketch نیازی به مهارت حرفهای در طراحی ندارند. هدف این قابلیت، فراهم کردن راهی سادهتر برای انتقال ایدههای بصری است، بهخصوص زمانی که توضیح کامل یک طرح فقط با متن دشوار باشد.


کاربران میتوانند با نوشتن «Sketch@» در ChatGPT به این قابلیت دسترسی پیدا کنند. همچنین OpenAI قالبهای آمادهای را برای برخی از فرمتهای پرکاربرد معرفی کرده است. کاربران میتوانند بهجای شروع از یک صفحه خالی، قالبهایی مانند پوستر یا محصولات تبلیغاتی را انتخاب کنند و اطلاعات، عناصر طراحی و سبک مورد نظر خود را روی همان قالب اعمال کنند.
قابلیت دیگری نیز برای اشتراکگذاری پرامپتها اضافه شده است. کاربران هنگام اشتراکگذاری یک تصویر میتوانند پرامپتی را که برای ساخت آن استفاده کردهاند نیز در اختیار دیگران قرار دهند.
افراد دیگر میتوانند همان ایده را با تصاویر و جزئیات شخصی خود اجرا کنند و نسخه متفاوتی از همان مفهوم بسازند.
دو مدل جدید GPT-Image برای توسعهدهندگان
شرکت OpenAI همزمان با ChatGPT Images 2.5، دو مدل تازه را برای Images API معرفی کرده است. این دو مدل GPT-Image-2.5 Flare و GPT-Image-2.5 Sunburst نام دارند و برای نیازهای متفاوت توسعهدهندگان طراحی شدهاند.
مدل GPT-Image-2.5 Flare گزینه پیشفرض برای بیشتر کاربردها معرفی شده است. این مدل همان بهبودهای اصلی Images 2.5 در کیفیت، سرعت و ویرایش را ارائه میکند و در مقایسه با GPT-Image-2، تصاویر باکیفیتتری را با ۵۰ درصد تأخیر کمتر تولید میکند.
شرکت OpenAI این مدل را برای تولید محتوای شبکههای اجتماعی، تصاویر سازندگان محتوا، تجربههای مرتبط با محصول، جستوجوی بصری، نمونهسازی سریع و تولید تصاویر در مقیاس بالا مناسب میداند.
مدل GPT-Image-2.5 Sunburst برای پروژههایی طراحی شده است که دقت و کنترل بیشتری نیاز دارند. این مدل زمان بیشتری برای تولید تصویر صرف میکند، اما برای کارهایی مانند تصاویر تبلیغاتی نهایی یا عکسهای حرفهای محصول مناسبتر است.
همچنین OpenAI اعلام کرده است که Images 2.5 همچنان از سازوکارهای ایمنی این شرکت استفاده میکند. پرامپتها و تصاویر برای جلوگیری از تولید محتوای مضر بررسی میشوند.
این شرکت استفاده از فراداده C2PA و واترمارک نامرئی را نیز ادامه میدهد تا شناسایی تصاویر تولیدشده با ابزارهای OpenAI آسانتر شود.
مدل ChatGPT Images 2.5 از ۸ سپتامبر ۲۰۲۶ برای کاربران ChatGPT، ChatGPT Work و Codex در همه طرحها و روی دسکتاپ، موبایل و وب در حال عرضه است. دو مدل GPT-Image-2.5 Flare و GPT-Image-2.5 Sunburst نیز از طریق API در اختیار توسعهدهندگان قرار گرفتهاند.
















