新闻资讯 你的位置:万博manbext体育官网(中国)官方网站登录入口 > 新闻资讯 > 现金万博manbext体育官网app平台在 GEdit-Bench 基准测试中-万博manbext体育官网(中国)官方网站登录入口
现金万博manbext体育官网app平台在 GEdit-Bench 基准测试中-万博manbext体育官网(中国)官方网站登录入口

发布日期:2026-09-26 01:13    点击次数:162


现金万博manbext体育官网app平台在 GEdit-Bench 基准测试中-万博manbext体育官网(中国)官方网站登录入口

比 Nano Banana 更擅长 P 细节的图像裁剪模子来了,还是更懂汉文的那种。

就像这么,条款 AI "把中间白色衣裳戴口罩女生的手势改成 OK ",原图如下:

这个名为UniWorld-V2的模子能作念到好意思满修改。

而 Nano Banana 则未能顺利 get 到请示词的意图。

模子背后,是兔展智能 & 北京大学的 UniWorld 团队的最新时刻扫尾:

他们提议了一种名为 UniWorld-R1 的蜕变型图像裁剪后期覆按框架,该框架初次顽强化学习(RL)战略优化应用于长入架构的图像裁剪模子,是第一个视觉强化学习框架。基于此,他们推出了新一代模子 UniWorld-V2。

UniWorld-V2 在 GEdit-Bench 和 ImgEdit 等行业巨擘基准测试中取得了 SOTA 得益,在空洞阐述上超过了如 OpenAI 的 GPT-Image-1 等顶尖闭源模子。

一皆来看详备时刻阐发。

刚劲的中翰墨体掌合手与精良化可控

功能上,UniWorld-V2 在实质应用中展现了 SFT 模子难以企及的精良化规矩力。

中翰墨体掌合手

在论文的"海报裁剪"示例中,模子能精确引诱指示,并渲染出"月满中秋"和"月圆东谈主圆事事圆"等笔画复杂的艺术中翰墨体,效果了了、语义准确。

能作念到思改啥字改啥字,只需一句 Prompt。

精良化空间可控

在"红框规矩"任务中,用户不错通过画框(如红色矩形框)来指定裁剪区域,模子粗略严格效用该空间铁心,已毕"将鸟移出红框"等高难度精良操作。

全局光影交融

模子能深远引诱"给场景再行打光"等指示,使物体当然融入场景之中,让画面变得更长入谐和,况兼光影交融度极高。

中枢蜕变:UniWorld-R1 框架

已毕以上功能,磋商团队的中枢蜕变是提议了 UniWorld-R1 框架。

传统的图像裁剪模子依赖监督微调(SFT),大批存在对覆按数据过拟合、泛化才气差的问题。此外,还存在面临裁剪指示和任务的各样性,缺少通用奖励模子的瓶颈。

UniWorld-R1 框架的中枢上风在于:

首个基于强化学习的长入架构:UniWorld-R1 是业内首个基于战略优化(RL)的图像裁剪后期覆按框架。它禁受了 Diffusion Negative-aware Finetuning (扩散负向感知微调,DiffusionNFT)时刻,这是一种无需似然忖度的战略优化口头,覆按更高效,况兼允许使用高阶采样器。

MLLM 手脚免覆按奖励模子:针对裁剪任务各样性导致缺少通用奖励模子的挑战,UniWorld-R1 始创性地使用多模态谎言语模子(MLLM,如 GPT-4V)手脚长入的、免覆按的奖励模子。通过欺骗 MLLM 的输出 logits(而非单一评分)来提供精良化的隐式响应,极地面擢升了模子对东谈主类意图的对皆才气。

如下图所示,UniWorld-R1 的 pipeline 主要包括三个部分:采样、MLLM 评分和 DiffusionNFT,这三个部分迟缓将模子与最优战略对皆。

全面超过 SOTA,分数领跑

施行方面,磋商团队整理了一个包含 27572 个基于指示的裁剪样本的数据集。

这些样底本自 LAION、LexArt 和 UniWorldV1。为了增强任务各样性,加入了至极的文本裁剪和红框规矩任务,共造成九种不同的任务类型。

磋商团队覆按 FLUX.1-Kontext [ Dev ] 、Qwen-Image-Edit [ 2509 ] 和 UniWorld-V2 手脚基础模子,并禁受 ImgEdit 和 GEdit-Bench 手脚测试基准。前者将多种挑升任务长入为一个通用框架以进行全面模子比拟,后者通过丰富的当然话语指示评估通用图像裁剪。

在 GEdit-Bench 基准测试中,UniWorld-V2(基于 UniWorld-R1 覆按)赢得了 7.83 的惊东谈主高分,显赫优于 GPT-Image-1 [ High ] (7.53 分)和 Gemini 2.0(6.32 分)。在 ImgEdit 基准上,UniWorld-V2 相似以 4.49 分领跑,超过了通盘已知的开源和闭源模子。

更蹙迫的是,UniWorld-R1 框架具有极强的通用性。当该框架被应用于 Qwen-Image-Edit 和 FLUX-Kontext 等其他基础模子时,相似带来了显赫的性能擢升,充分诠释了其手脚通用后期覆按框架的迢遥价值。

该口头显赫增强了通盘基础模子在 ImgEdit 基准上的阐述。关于 FLUX.1-Kontext [ Dev ] ,举座分数显赫提高,从 3.71 高潮到 4.02,跳跃了较强的 Pro 版块(4.00)。相似,在应用于 Qwen-Image-Edit [ 2509 ] 时,该口头将其分数从 4.35 擢升到 4.48,已毕了开源模子中的起头进性能,并超过了顶级闭源模子如 GPT-Image-1。

除了总得分的擢升以外,UniWorld-FLUX.1-Kontext 在"诊疗"、"索要"和"移除"维度上阐述出显赫的性能擢升,而 UniWorld-Qwen-Image-Edit 则在"索要"和"搀杂"维度上阐述优异。此外,UniWorld-V2 达到了最好性能。这一风景标明,该口头粗略解锁和显赫提高基础模子中之前未开发的后劲。

在域外 GEdit-Bench 上,UniWorld-R1 为三种模子展示了刚劲的泛化性能。它使 FLUX.1-Kontext [ Dev ] 模子的总分从 6.00 擢升到 6.74,阐述超过了 Pro 版块(6.56)。关于 Qwen-Image 模子,其得分从 7.54 加多到 7.76。同期,UniWorld-V2 在这一基准测试中开导了新的起头进水平,超过了通盘列出的模子,包括 Qwen-Image-Edit(7.56)和 GPT-Image-1(7.53)。这一扫尾阐发该口头灵验地保留和增强了在未见数据散布上的中枢裁剪才气,展示了刚劲的泛化才气。

为了全面评估,磋商东谈主员还对 FLUX.1 和 Qwen 系列进行了东谈主工偏好磋商,参与者将本文的微调模子与其基础模子和更刚劲的版块进行比拟。他们被条款在两个维度上聘请最好扫尾:指示对皆和图像质地。

用户在通盘圭臬中更倾向于聘请 UniWorld-FLUX.1-Kontext 而不是 FLUX.1-Kontext [ Dev ] 。此外,它在裁剪才气上阐述出较强的上风,尤其是在与更刚劲的官方版块 FLUX.1-Kontext [ Pro ] 的比拟中。总体而言,UniWorld-FLUX.1-Kontext 因其优胜的指示遵照才气而赢得更多的可爱,尽管官方模子在图像质地上稍许胜出。这证实了该口头粗略灵验地带领模子生成更相宜东谈主类偏好的输出。

这次发布的 UniWorld-V2,是基于团队早先的 UniWorld-V1 构建的。UniWorld-V1 手脚业内首个长入引诱与生成的模子,其开源时分最初于谷歌 Nano Banana 等后续闻明模子长达三个月,为多模态边界的长入架构探索奠定了蹙迫基础。

另外,UniWorld-R1 的论文、代码和模子均已在 GitHub 和 Hugging Face 平台公开发布,以撑持后续磋商。

论文地址:

https://arxiv.org/abs/2510.16888

GitHub 联贯:

https://github.com/PKU-YuanGroup/UniWorld

一键三连「点赞」「转发」「防御心」

接待在指摘区留住你的思法!

—  完  —

� � 点亮星标 � �

科技前沿进展逐日见现金万博manbext体育官网app平台



Powered by 万博manbext体育官网(中国)官方网站登录入口 @2013-2022 RSS地图 HTML地图