Qwen Image 2.1 با مدل ۷ میلیارد پارامتری و قابلیت ویرایش تصاویر معرفی شد

علیبابا از جدیدترین مدل هوش مصنوعی تصویرساز خود با نام Qwen Image 2.1 رونمایی کرد؛ مدلی متنباز با ۷ میلیارد پارامتر که علاوه بر تولید تصویر، برای ویرایش دقیق تصاویر نیز توسعه یافته است و از شفافیت و لایههای RGBA پشتیبانی میکند.
به گفته علیبابا، Qwen Image 2.1 با هدف ایجاد تعادل میان کیفیت خروجی، سرعت پردازش و هزینه توسعه یافته است. وزنهای این مدل در دسترس عموم قرار گرفته و کاربران و توسعهدهندگان میتوانند از نسخه متنباز آن استفاده کنند.

پشتیبانی Qwen Image 2.1 از تصاویر شفاف
یکی از قابلیتهای شاخص مدل جدید، پشتیبانی بومی از شفافیت و فرمت RGBA است. این ویژگی به Qwen Image 2.1 اجازه میدهد تصاویر دارای پسزمینه شفاف را تولید یا ویرایش کند و در پروژههایی که به ترکیب چند تصویر یا تغییر متن روی تصاویر شفاف نیاز دارند، مورد استفاده قرار گیرد.
مدل جدید علیبابا همچنین میتواند همزمان از حداکثر ۱۰ تصویر بهعنوان مرجع استفاده کند. کاربر با کمک این قابلیت میتواند بخشهای مشخصی از تصویر را تغییر دهد، در حالی که مدل تلاش میکند ویژگیها و جزئیات اصلی سوژه حفظ شود.
به گفته علیبابا، Qwen Image 2.1 در ویرایش پرتره و تصاویر محصولات میتواند ویژگیهای ظاهری سوژه را با دقت مناسبی حفظ کند؛ قابلیتی که برای تولید محتوای تجاری و تبلیغاتی اهمیت دارد.

کاربردهای متنوع در تولید محتوای تصویری
Qwen Image 2.1 تنها برای تولید تصاویر معمولی طراحی نشده و طیف گستردهای از کاربردهای تصویری را هدف قرار داده است. تولید تصاویر پانوراما، اینفوگرافیک، محتوای مربوط به پرو مجازی لباس و ایجاد بافتهای واقعگرایانه از جمله زمینههایی هستند که این مدل برای آنها بهینه شده است.
علیبابا همچنین روی توانایی مدل در تولید تایپوگرافی باکیفیت تمرکز کرده است؛ موضوعی که یکی از چالشهای رایج مدلهای تولید تصویر بهشمار میرود.
یکی از نمونههای ارائهشده توسط علیبابا، قابلیت ساخت استوریبرد از روی تصاویر مرجع را نشان میدهد. در این آزمایش، سه تصویر از زوایای مختلف یک شخصیت به مدل داده شد و Qwen Image 2.1 توانست بر اساس آنها یک استوریبرد کامل تولید کند.

مدل متنباز علیبابا در برابر مدلهای بزرگتر
علیبابا میگوید معماری ۷ میلیارد پارامتری Qwen Image 2.1 در کنار سرعت بالای استنتاج، به این مدل اجازه میدهد با وجود ابعاد نسبتاً کوچک، در برخی سناریوها با مدلهای بسته و بزرگتر رقابت کند.
این موضوع بهویژه هنگام پردازش چند تصویر ورودی اهمیت پیدا میکند؛ زیرا مدل میتواند بدون نیاز به معماری بسیار سنگین، اطلاعات مربوط به چند مرجع تصویری را برای تولید یا ویرایش خروجی ترکیب کند.
