消息!让生成式模型「画」出空间智能,而非强迫LLM输出「坐标」! 浙大提出Agentic空间认知评估框架
如果你问一个人 “杯子在哪?”,他通常会直接用手指给你看,而不是面无表情地回答:“目标位于屏幕横坐标 345 至 412、纵坐标 512 至 600 的边界框内”。然而,在现有空间认知评测中,我们却一直在强迫 AI 用这种 “反直觉” 的坐标方式来证明自己的空间认知能力。
(相关资料图)
空间判断本来就活在连续的视觉场景里,但现有 benchmark 几乎都要求模型用坐标、选项或文字作答。这对文本 VLM 已不够自然,天然工作在像素空间、本可直接 “画” 出答案的图像生成模型更是被挡在门外。
生成式模型会不会是承载空间认知更自然的载体?如果让模型直接把答案 “画” 出来,怎样让它把空间判断表达清楚?在不依赖人工的情况下,如何准确判断它画得对不对?进一步看,生成式模型与文本输出 VLM 在不同空间任务上的能力差异究竟在哪里?
近日,浙江大学 OmniAI 团队在《Show, Don’t Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text》中提出 ProVisE,让图像生成模型直接在图中回答空间问题,并将视觉答案还原为原 benchmark 可以评分的结构化预测。
- 论文链接:https://arxiv.org/abs/2607.21072
- 项目地址:https://zju-omniai.github.io/ProVisE/
- Github 链接:https://github.com/ZJU-OmniAI/ProVisE
- Benchmark 链接:https://huggingface.co/datasets/wx91726/SpatialGen-Bench
视频链接:https://mp.weixin.qq.com/s/M78bQEqADqvY4GufqZ4-iA
ProVisE:生成模型如何 “画出答案”?
为了让生成模型能够以自己擅长的方式回答空间问题,我们提出了 ProVisE(Protocolized Visual Evaluation)框架。它不再要求模型输出干巴巴的文本或坐标,而是通过视觉协议,引导模型直接在图像上 “作答”:标记目标、填充方向网格、生成深度图、涂出目标区域,或者画出机器人的运动轨迹。
视觉协议是 ProVisE 的基本单元。每套协议都包含一段 guidance prompt,规定模型应该怎样展示答案;同时配有对应的 parser,将生成图像中的颜色、位置、区域等恢复为结构化预测。
整个流程可以概括为三步:首先,Protocol Router 根据任务选择合适的视觉协议;随后,图像生成模型按照 Guidance Prompt 产生可解析的视觉答案;最后,Protocol Parser 将像素结果转换成原 benchmark 所需的标签、点、掩码、状态或轨迹。
文本输出 VLM 直接生成结构化答案;图像生成模型通过视觉协议生成图像答案,再由 parser 恢复为原任务所需的预测。
Agentic Builder:自动化构建视觉评测协议
为了应对形式各异的空间 benchmark,我们在 ProVisE 中内置了Agentic Protocol Construction框架,根据任务的输入、答案结构和评分规则,自动构建相应的 “生成 — 解析” 协议。
Agentic Builder 根据任务选择 Reuse、Build 或 Fallback 路径,构建并验证对应的视觉协议。
Agentic Builder 逐任务扫描数据、输入形式、答案结构和评分规则,将其统一为任务规范;随后根据任务特点选择三种协议构建模式:
- Reuse:直接复用兼容的已有协议
- Build: 利用已注册的解析组件组装新协议
- Fallback: 在确定性组件无法覆盖时,由辅助 VLM 解析生成图像并恢复结构化预测
协议构建完成后还需经过验证,确保视觉答案能够正常生成、解析并接入原指标;通过后即被冻结,用于所有图像生成模型的评测。
正如下图例子展示,模型可以直接把目标公交车点出来,把机械臂的移动轨迹画在原图上;判断 A、B 两点谁更近时,就生成一张深度图。面对 “缆车上还能否再坐一个人” 这样的问题,模型会把第二位乘客补到座椅上,直观展示空间是否足够。随后,相应的解析器再将这些图像答案转换为坐标、选项或轨迹。
图中展示了图像生成模型从任务输入、视觉作答到结果解析与评估的完整过程。
SpatialGen-Bench:全面刻画空间认知能力
为了系统描绘空间认知能力,我们构建了 SpatialGen-Bench,涵盖从直接视觉感知、场景理解、空间推理到具身交互的 14 项子任务:
- 空间感知:考察模型从画面中提取基础几何与空间属性的能力,包括计数、相对深度、朝向和尺寸比较
- 空间理解:要求模型整合多个物体及不同视角的信息,形成对物体关系与整体场景的理解,包括目标 grounding、关系分析、视角判断和场景建模
- 空间推理:在场景理解基础上,检验模型能否结合空间关系和物理约束进行多步推演,包括多步推理、状态预测和几何可行性判断
- 空间交互:进一步将空间认知延伸至行动,考察模型能否据此作出决策,包括可供性 grounding、导航和轨迹规划
SpatialGen-Bench 将 14 项任务组织为感知、理解、推理和交互四个层级。
Leaderboard
Claude Fable 5 与 GPT-5.6 Sol 均超过 80 分,与 Kimi K3 一起霸榜前三,GPT-5.4 得分为 61.04;图像生成模型中,GPT-5 Image 2 以 54.49 分排名第一。
生成模型的空间能力怎么样?
在 SpatialGen-Bench 上,我们比较了 20 个文本输出 VLM 和 11 个图像生成模型。结果显示,两类模型的优势集中在不同任务上:
1.图像生成模型展现出更直接的 “空间直觉”。当任务可以直接用深度图或空间标记回答时,生成模型表现出较强竞争力。直接在像素空间作答,减少了将连续空间关系转换成文字时的信息损耗。
左:两类模型在不同空间任务上的相对优势;右:图像生成模型的失败归因。
2. 在 GPT-5.4 做错的题目中,GPT Image 2 做对了 37%。两类模型做对的并不是同一批题,因而具有明显的互补性。
3.文本输出 VLM 在需要抽象推理的任务上仍占优势。计数、尺寸比较、几何可行性和状态预测,需要统计多个对象、比较尺度、组合几何约束或推演状态变化;在空间推理层级,VLM 组平均领先 17.6 个百分点。
4.生成成功并不意味着空间答案正确。失败归因显示,88.03% 的失败样本已经生成图像并解析出有效预测,只是预测结果错误。主要问题不是图像没有生成或无法解析,而是图中呈现的空间状态不准确。
总结与展望
我们希望这项工作提供一种新的空间智能视角。真正理解物理世界的智能体,不应只是会计算坐标的 “文本机器”,还应能够在像素空间中直接表达并预演空间状态。未来系统也不必在 Show 与 Tell 之间二选一:文本或 latent 表示承担约束规划与组合推理,视觉生成负责呈现空间状态,再由确定性工具完成验证。理解、生成与验证的协同,或许比单纯扩大任一类模型的规模更接近通用空间智能。
团队介绍
浙江大学 OmniAI 团队致力于大模型与智能体、多模态空间推理、具身智能和情感交互等方向的研究。作者王旭为大四本科生,已拟录取至浙江大学;姚凯翔为硕士一年级研究生。张文祺与张旭鸿为共同通讯作者,张旭鸿为 OmniAI 团队负责人。
相关阅读
-
焦点热门:年轻人重新定义北京的公园:青春自有安放处
2026-08-09 -
快看点丨成渝中线高铁简州站主体结构完工
2026-08-08 -
赶鸭子上架:穆里尼奥决定牺牲自己的同胞来替代罗德里|每日快播
2026-08-08 -
猪价下跌冲击业绩,唐人神7月生猪销售收入下降47%,中报预亏超8亿元创新高
2026-08-08 -
苏州市相城区黄桥街道:探金融奥秘 育小小银行家|今日热文
2026-08-09 -
PUMA库存优化明显 安踏入股后中国市场长期增长可期
2026-08-09 -
*ST发展:与预重整投资人签署《重整投资协议》 股票复牌 热点
2026-08-09 -
韩国6月旅行收支实现近6亿美元顺差 创新冠疫情以来最高纪录
2026-08-09 -
美团外卖:因暴雨红色预警,已陆续暂停相应区域的外卖配送服务 新视野
2026-08-09 -
彩经前瞻3:利勒斯特罗姆vs罗森博格,落寞豪门能否重新崛起
2026-08-09 -
东体:客胜海牛,申花拼出队史正式比赛第500场胜利 焦点热议
2026-08-09 -
最新消息:上季英超仅首发7次,热刺仍花6000万镑签萨维尼奥
2026-08-09 -
陆毅的白发母亲:丈夫意外离世她很自责,儿子儿媳让她晚年不流泪
2026-08-09 -
3年7300万续约!火箭无缘签回旧将,7换1交易,斯通亲手送走准全明星 观天下
2026-08-09 -
足球+啤酒氛围感拉满 青泥洼观赛第二现场开启大连地道风味盛宴
2026-08-09 -
观焦点:交房流程为何重要买房决策更稳妥?
2026-08-09 -
通讯!灵巧手赛道重磅选手+1!蓝思科技+中科慧灵,要推出37个关节自由度
2026-08-09 -
关注:置换安排为何重要买房决策更稳妥?
2026-08-09 -
今日热搜:7月份工业生产者出厂价格同比上涨3.5%
2026-08-09 -
焦点热门:年轻人重新定义北京的公园:青春自有安放处
2026-08-09 -
焦点精选!上海44岁网约车司机充电时猝死,保险公司拒赔,法院判赔60万
2026-08-09 -
刘殿座终于爆发!之前因比赛中没有下地扑救,曾饱受蓉城球迷质疑_每日快播
2026-08-09 -
最新快讯!火箭残骸撞月视频,假的!
2026-08-09 -
今日热搜:汤臣倍健Q2线上增19%毛利提升 规模效应释放长期利好
2026-08-09 -
今日播报!赵丽颖逛商场挑碗!看清餐具价格,才懂一线女星居家开销有多实在
2026-08-09 -
今日热文:四棵卫生院社区运动健康中心开放,开发区·铁山区五大特色运动方队“动起来”
2026-08-09 -
1.45 亿重磅!阿森纳锁定欧洲顶级巨星!彻底激活低迷萨卡
2026-08-09 -
北京市第十二届民族传统体育运动会开幕 设两大板块22个项目
2026-08-09 -
快资讯:实丰文化新提交“-”商标注册申请
2026-08-09 -
阿森纳重磅补强!中后场身价逼近9亿欧,全欧顶级豪华阵容成型!
2026-08-09 -
穆帅挖到宝了!皇马 21 岁天才一战封神!新赛季主力稳了 每日焦点
2026-08-09 -
Here we go!罗马诺确认阿劳霍租借加盟利物浦,含买断条款-当前热议
2026-08-08 -
梅州客家3-2佛山南狮,特里布莱点射双响,罗鸿宝建功
2026-08-08 -
全市场:鲁加尼将离开尤文,蒙扎领跑租借争夺 焦点热讯
2026-08-08 -
台风“白海豚”逼近 上海危险区域已转移3万人
2026-08-08 -
快看点丨成渝中线高铁简州站主体结构完工
2026-08-08 -
老同学问我退休金多少,我谎称2800,不料第二天接到3个电话_每日头条
2026-08-08 -
苏州东吴2-1长春亚泰,埃斯特雷拉补时绝杀,比吉耶尔、谭龙破门 观点
2026-08-08 -
生意社涤纶FDY8月8日均线下穿 均差为-27.75元/吨_微资讯
2026-08-08 -
努内斯:24年末曼市德比是生涯最难比赛;不能说没冠军就是失败_焦点播报
2026-08-08 -
即时看!8月8日董宇辉开播五分钟就冲到榜一!与辉同行开学季专场太火爆
2026-08-08 -
信息:葡媒:波尔图考虑外租小将罗德里戈-莫拉,英超是潜在目的地
2026-08-08 -
一个意甲金靴,为啥连阿根廷大名单都摸不到?答案在枕边!|速读
2026-08-08 -
西班牙六台:阿劳霍将租借加盟利物浦,非强制买断费约6000万欧|热点评
2026-08-08 -
赶鸭子上架:穆里尼奥决定牺牲自己的同胞来替代罗德里|每日快播
2026-08-08 -
莫雷托:利雅得新月过去几小时再次就卡萨多联系巴萨
2026-08-08 -
今年上半年人形机器人领域新设企业11.6万户
2026-08-08 -
Apple智能可配合阿里千问模型工作
2026-08-08 -
今年上半年人形机器人领域新设企业11.6万户_实时
2026-08-08 -
勒夫想投76人与詹姆斯重聚,莫里斯先开抢:最后一个老将名额是我的!
2026-08-08 -
意外!阿劳霍租借利物浦24小时内完成,巴萨已放行含买断条款
2026-08-08 -
决胜局4-8落后连拿7分逆转!19岁松岛辉空仰天怒吼 日媒:无愧头号种子 短讯
2026-08-08
精彩推荐
阅读排行
- 东体:客胜海牛,申花拼出队史正式比赛第500场胜利 焦点热议
- 最新消息:上季英超仅首发7次,热刺仍花6000万镑签萨维尼奥
- 陆毅的白发母亲:丈夫意外离世她很自责,儿子儿媳让她晚年不流泪
- 25岁中医准研究生在开封万岁山景区当NPC把脉走红:每天4次,每次40分钟,让游客在不知不觉中记住养...
- 3年7300万续约!火箭无缘签回旧将,7换1交易,斯通亲手送走准全明星 观天下
- 足球+啤酒氛围感拉满 青泥洼观赛第二现场开启大连地道风味盛宴
- 观焦点:交房流程为何重要买房决策更稳妥?
- 通讯!灵巧手赛道重磅选手+1!蓝思科技+中科慧灵,要推出37个关节自由度
- 关注:置换安排为何重要买房决策更稳妥?
- 今日热搜:7月份工业生产者出厂价格同比上涨3.5%


营业执照公示信息