2025年6月26日,Qwen團(tuán)隊(duì)發(fā)布了 Qwen VLo ,一個(gè)定位是“unified multimodal understanding and generation model"的模型,包括多模態(tài)的理解和生成。
根據(jù)官方的介紹博客,Qwen VLo包含下面的功能: 圖像生成:文生圖、2D卡通圖像轉(zhuǎn)真實(shí)圖像圖像編輯:例如修改某個(gè)主體、更換顏色、更換風(fēng)格圖像算法能力:例如檢測框、canny 算子、圖像分割結(jié)果經(jīng)過一段時(shí)間的測試,我個(gè)人的總結(jié)是: 生圖能力:效果比較差,感覺是一兩年前生圖模型…。
