اخبار فناوری

Qwen Image 2.1 با مدل ۷ میلیارد پارامتری و قابلیت ویرایش تصاویر معرفی شد

علی‌بابا از جدیدترین مدل هوش مصنوعی تصویرساز خود با نام Qwen Image 2.1 رونمایی کرد؛ مدلی متن‌باز با ۷ میلیارد پارامتر که علاوه بر تولید تصویر، برای ویرایش دقیق تصاویر نیز توسعه یافته است و از شفافیت و لایه‌های RGBA پشتیبانی می‌کند.

به گفته علی‌بابا، Qwen Image 2.1 با هدف ایجاد تعادل میان کیفیت خروجی، سرعت پردازش و هزینه توسعه یافته است. وزن‌های این مدل در دسترس عموم قرار گرفته و کاربران و توسعه‌دهندگان می‌توانند از نسخه متن‌باز آن استفاده کنند.

Qwen Image 2.1

پشتیبانی Qwen Image 2.1 از تصاویر شفاف

یکی از قابلیت‌های شاخص مدل جدید، پشتیبانی بومی از شفافیت و فرمت RGBA است. این ویژگی به Qwen Image 2.1 اجازه می‌دهد تصاویر دارای پس‌زمینه شفاف را تولید یا ویرایش کند و در پروژه‌هایی که به ترکیب چند تصویر یا تغییر متن روی تصاویر شفاف نیاز دارند، مورد استفاده قرار گیرد.

مدل جدید علی‌بابا همچنین می‌تواند هم‌زمان از حداکثر ۱۰ تصویر به‌عنوان مرجع استفاده کند. کاربر با کمک این قابلیت می‌تواند بخش‌های مشخصی از تصویر را تغییر دهد، در حالی که مدل تلاش می‌کند ویژگی‌ها و جزئیات اصلی سوژه حفظ شود.

به گفته علی‌بابا، Qwen Image 2.1 در ویرایش پرتره و تصاویر محصولات می‌تواند ویژگی‌های ظاهری سوژه را با دقت مناسبی حفظ کند؛ قابلیتی که برای تولید محتوای تجاری و تبلیغاتی اهمیت دارد.

Qwen Image 2.1

کاربردهای متنوع در تولید محتوای تصویری

Qwen Image 2.1 تنها برای تولید تصاویر معمولی طراحی نشده و طیف گسترده‌ای از کاربردهای تصویری را هدف قرار داده است. تولید تصاویر پانوراما، اینفوگرافیک، محتوای مربوط به پرو مجازی لباس و ایجاد بافت‌های واقع‌گرایانه از جمله زمینه‌هایی هستند که این مدل برای آن‌ها بهینه شده است.

علی‌بابا همچنین روی توانایی مدل در تولید تایپوگرافی باکیفیت تمرکز کرده است؛ موضوعی که یکی از چالش‌های رایج مدل‌های تولید تصویر به‌شمار می‌رود.

یکی از نمونه‌های ارائه‌شده توسط علی‌بابا، قابلیت ساخت استوری‌برد از روی تصاویر مرجع را نشان می‌دهد. در این آزمایش، سه تصویر از زوایای مختلف یک شخصیت به مدل داده شد و Qwen Image 2.1 توانست بر اساس آن‌ها یک استوری‌برد کامل تولید کند.

Qwen Image 2.1

مدل متن‌باز علی‌بابا در برابر مدل‌های بزرگ‌تر

علی‌بابا می‌گوید معماری ۷ میلیارد پارامتری Qwen Image 2.1 در کنار سرعت بالای استنتاج، به این مدل اجازه می‌دهد با وجود ابعاد نسبتاً کوچک، در برخی سناریوها با مدل‌های بسته و بزرگ‌تر رقابت کند.

این موضوع به‌ویژه هنگام پردازش چند تصویر ورودی اهمیت پیدا می‌کند؛ زیرا مدل می‌تواند بدون نیاز به معماری بسیار سنگین، اطلاعات مربوط به چند مرجع تصویری را برای تولید یا ویرایش خروجی ترکیب کند.

نمایش بیشتر

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

دکمه بازگشت به بالا