切换到宽版
开启辅助访问
登录
立即注册
搜索
搜索
搜索
首页
Portal
论坛
同城
人才网
工具
菲龙网工具
个人中心
关于我们
每日签到
本地新闻
时事评论
华人世界
中国新闻
新闻视频
国际新闻
娱乐新闻
科技新闻
菲龙广场
房产网
菲龙速聘
二手交易
便民电话
美食餐厅
旅游签证
物流速运
商品买卖
二手车市场
严选
话费充值
便民电话
贺词页面
瀑布流页
汇率查询
APP下载
每日签到
我的任务
道具商店
每日签到
我的任务
道具商店
更改用户名
关于菲龙网
About US
联系菲龙网
活动回顾
加入我们
本版
用户
菲龙网
»
论坛
›
新闻频道
›
科技新闻
›
Salesforce开源统一多模态模型BLIP3-o,图像理解与生成 ...
菲龙网编辑部7
有 744 人收听 TA
152908
主题
152925
回复
179257
积分
收听TA
发消息
加好友
本文来自
科技新闻
订阅
|
收藏
(
2953
)
菲龙网编辑部7发布过的帖子
0/41
这个女人什么来路?连李诚儒都对她赞不绝口
0/56
肖战的藏海传首播领跑,《折腰》逆袭,赴山海因李凯馨遇播出危机
0/48
积压两年《折腰》爆冷成黑马!破古偶同质化困局,权谋成破圈密码
0/74
给《藏海传》演员演技做个排名 白冰第七 肖战第三 第一毫无悬念
0/60
看了肖战《藏海传》,再看胡歌《琅琊榜》,真是没对比就没伤害
0/49
冲着杨紫胡歌去看的《生命树》,却被44岁的男二号给惊艳了
0/64
《甄嬛传》全剧只有大胖橘和宜修,才是真正天造地设的一对
0/45
《藏海传》若非高明遇害,藏海怎能发现,恩公接近他的真实算计
0/68
3重人格分裂?首播4集就好评如潮,网友:看完不敢开冰箱、上厕所
查看TA的全部帖子>>
Salesforce开源统一多模态模型BLIP3-o,图像理解与生成全拿下
时间:2025-5-23 10:03
0
61
|
复制链接
|
互动交流
显示全部楼层
阅读模式
直达楼层
马上注册,结交更多好友
您需要
登录
才可以下载或查看,没有账号?
立即注册
x
OpenAI 的 GPT-4o 在图像理解、生成和编辑任务上展现了顶级性能。流行的架构猜想是:
Tokens → [Autoregressive 模型] → [Diffusion 模型] → 图像像素
该混合架构将自回归与扩散模型的优势结合。Salesforce Research、马里兰大学、弗吉尼亚理工、纽约大学、华盛顿大学的研究者在最新的研究(统一多模态模型 BLIP3-o)中也采用了自回归 + 扩散框架。
论文标题:BLIP3-o: A Family of Fully Open Unified Multimodal Models—Architecture, Training and Datase论文地址:https://arxiv.org/pdf/2505.09568v1GitHub 代码:https://github.com/JiuhaiChen/BLIP3o模型权重:https://huggingface.co/BLIP3o/BLIP3o-Model在线演示:https://huggingface.co/spaces/BLIP3o/blip-3o预训练:https://huggingface.co/datasets/BLIP3o/BLIP3o-Pretrain-Long-Caption指令微调:https://huggingface.co/datasets/BLIP3o/BLIP3o-60k
在这个框架里,自回归模型先生成连续的中间视觉特征,用以逼近真实图像表示,进而引出两个关键问题:
[ol]真实特征来源 (Ground-truth features):用 VAE 还是 CLIP 将图像编码为连续特征?特征对齐方式:使用 MSE 损失,还是借助扩散模型(Flow Matching)来对齐预测与真实特征?[/ol]
统一多模态下的图像生成
研究者考察两种图像编码–解码范式:
VAE:将图像编码为 low level 像素特征,以获得更好的重建质量。但 VAE 编码器在处理更高分辨率输入时,会生成更长的向量序列,从而增加训练过程中的计算负担。CLIP + Diffusion:先将图像映射到 high level 语义特征,再通过扩散模型重建真实图像。在实际操作过程中,会先用 CLIP 得到图像特征,然后基于 CLIP feature 训练一个扩散模型来重建图像。该方法好处是无论输入图像分辨率如何,每张图像都可编码为固定长度的连续向量 (比如长度为 64 的向量),这种编码方式能有较好的图像压缩率;但需要额外训练来使扩散模型适配不同的 CLIP 编码器。
针对自回归模型预测的视觉特征与 VAE/CLIP 提供的真实特征,有两类训练目标:
[ol]MSE:对预测特征与真实特征计算均方误差Flow Matching:基于自回归模型生成的预测特征,通过流匹配损失训练一个 Diffusion Transformer,用 Diffusion Transformer 的输出值来逼近 CLIP 或 VAE 特征[/ol]
结合不同的编码–解码架构与训练目标,共有三种设计选择:
CLIP + MSE:最小化预测表征与 CLIP 真实表征之间的 MSE, 比如 Emu2、SeedX。在生成图片的时候,自回归模型生成视觉特征,基于这个视觉特征,使用一个扩散模型来解码图片。CLIP + Flow Matching:以自回归模型预测的视觉特征为条件,使用流匹配损失来训练 Diffusion Transformer,以预测真实的 CLIP 表征。在生成图片的时候,自回归模型生成视觉特征,基于这个视觉特征,Diffusion Transformer 生成一个 CLIP feature,然后再基于这个 CLIP feature,使用一个轻量的扩散模型来解码图片。整个过程涉及两次扩散过程,第一次生成 CLIP feature,第二次生成真实图片。VAE + Flow Matching:以自回归模型预测的视觉特征为条件,使用流匹配损失来训练 Diffusion Transformer,以预测真实的 VAE 表征。在生成图片的时候,自回归模型生成视觉特征,基于这个视觉特征,Diffusion Transformer 生成一个 VAE feature, 由 VAE 解码器来生成真实图片。
Caption: 在统一多模态模型中,图像生成有三种设计方案。所有方案均采用自回归 + 扩散框架,但在图像生成组件上各有不同。对于流匹配损失,保持自回归模型冻结,仅微调图像生成模块 (Diffusion Transformer),以保留模型的语言能力。
下图对比了这三种方案在相同设置下的表现,证明CLIP + Flow Matching能在提示对齐、图像多样性与视觉质量之间取得最佳平衡。
Caption: 不同方案的对比
研究者发现将图像生成集成到统一模型时,自回归模型对语义级特征(CLIP)的学习比对像素级特征(VAE)的学习更为高效。同时,将流匹配 (Flow Matching)作为训练目标能够更好地捕捉图像分布,从而带来更丰富的样本多样性和更出色的视觉质量。同时有两个阶段的扩散过程,相对于传统的一个阶段的扩散模型,将图像生成分解成了两个阶段,第一阶段自回归模型和 diffusion transformer 只负责生成语义特征,第二阶段再由一个轻量的扩散模型来补全 low-level 特征,从而大幅减轻训练压力。
统一图像理解与生成
通过 CLIP 编码器,图像理解与图像生成共用同一语义空间,实现了两者的统一。
研究者采用顺序训练(late fusion)而非联合训练(early fusion),原因在于:
可以冻结自回归模型,保留其图像理解能力;把全部训练资源集中在图像生成模块,避免多任务间的相互干扰。
caption:联合训练(early fusion)同时更新理解和生成模块,顺序训练 (late fusion)先独立调优「理解」,再冻结骨干只训练「生成」。
BLIP3-o:统一多模态模型
基于上述对比,研究者选定CLIP + Flow Matching与顺序训练 (late fusion),构建了 4B 和 8B 参数的 BLIP3-o:
预训练数据:25M 开源图文 + 30M 专有图像图像字幕 (caption):均由 Qwen-2.5-VL-7B-Instruct 生成,平均 120 token;为增强对短提示的适应,还额外混入~10%(6M)的短字幕(20 token)4B 参数开源模型:纯 25M 开源图文对,及~10%(3M)短字幕指令微调:GPT-4o 生成 60K 条高质量示例,显著提升提示对齐和视觉美感
所有代码、模型、数据均陆续开源中,欢迎试用!
Caption: BLIP3-o 可视化示例
研究者发现:
模型能迅速调整至 GPT-4o 风格,提示对齐 (instruction following) 和视觉质量均大幅提升。
caption:图像理解表现
Caption: 图像生成的基准性能与人工评估
结论
本文首次系统地探索了结合自回归与扩散架构的统一多模态建模,评估了三个关键维度:图像表示(CLIP 特征 vs. VAE 特征)、训练目标(流匹配 vs. MSE)和训练策略(early fusion vs. 顺 late fusion)。实验结果表明,将 CLIP 嵌入与流匹配损失相结合,不仅加快了训练速度,也提升了生成质量。
基于这些发现,本文推出了 BLIP3-o, 一系列先进的统一多模态模型,并通过 BLIP3o-60k 6 万条指令微调数据集,大幅改善了提示对齐效果和视觉美感。研究者还正在积极开展该模型的应用研究,包括迭代图像编辑、视觉对话和逐步视觉推理。
回复
举报
高级模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登录后才可以回帖
登录
|
立即注册
点我进行验证
本版积分规则
发表回复
回帖后跳转到最后一页
关闭
站长推荐
/1
【点击免费下载】菲龙网移动APP客户端
【点击免费下载】菲龙网移动APP客户端,新闻/娱乐/生活资讯生活通,带你了解菲律宾多一点!
查看 »
扫码添加微信客服
快速回复
返回列表
返回顶部