هوش مصنوعی

مدل متن‌باز Qwen Image 2.1 برای تولید و ویرایش تصویر منتشر شد

به گفته علی‌بابا مدل جدید Qwen-Image-2.1 ترکیبی متعادل از کیفیت، سرعت و هزینه ارائه می‌دهد. وزن‌های این مدل اکنون به‌صورت متن‌باز در دسترس قرار گرفته و Qwen-Image-2.1 با معماری سبک ۷ میلیارد پارامتری توسعه یافته است.

معرفی مدل هوش مصنوعی تصویرساز Qwen Image 2.1

یکی از قابلیت‌های مهم این مدل، پشتیبانی بومی از شفافیت و لایه‌های RGBA است. Qwen-Image-2.1 می‌تواند تصاویر دارای پس‌زمینه شفاف را تولید و ویرایش کند و امکان ترکیب تصاویر و ویرایش متن در تصاویر شفاف را فراهم می‌کند.

در نمودار زیر عملکرد مدل جدید علی‌بابا Qwen Image 2.1 را در مقایسه با رقبای اصلی خود مشاهده می‌کنید.

این مدل همچنین از حداکثر ۱۰ تصویر مرجع پشتیبانی می‌کند و امکان ویرایش دقیق بخش‌های مشخص تصویر را در اختیار کاربر قرار می‌دهد. به‌گفته علی‌بابا، مدل در ویرایش پرتره‌ها و تصاویر محصولات می‌تواند جزئیات و ویژگی‌های اصلی سوژه را با دقت حفظ کند. در ادامه نمونه تصاویر پرجزئیات این مدل را می‌بینید.

مدل Qwen-Image-2.1 برای طیف گسترده‌ای از کاربردها نیز طراحی شده است و در تولید تصاویر پانوراما، اینفوگرافیک و تصاویر مربوط به پرو مجازی لباس عملکرد مناسبی دارد. این مدل همچنین روی تولید بافت‌های واقع‌گرایانه و تایپوگرافی باکیفیت تمرکز دارد.

در نمونه‌ای که علی‌بابا به نمایش گذاشته، هنگامی که تصاویری مرجعی از سه زاویه از یک شخصیت به هوش مصنوعی داده شد، این مدل توانست برای آن یک استوری‌برد کامل بسازد.

علی‌بابا می‌گوید معماری سبک Qwen-Image-2.1 در کنار سرعت بالای استنتاج، به‌ویژه هنگام کار با چند تصویر ورودی، باعث شده این مدل با وجود ابعاد کوچک‌تر بتواند در برابر بسیاری از مدل‌های بسته رقابت کند.

مقالات مرتبط

دکمه بازگشت به بالا