
ReLER 团队 投稿
量子位 | 公众号 QbitAI
图像编辑常有这种需求:一排物体摆在桌上,需要把最后方的物体移动到最前方。
这对人类来说是自然的视觉透视,但对AI而言,却是一连串复杂的几何难题。
物体靠近后尺寸要放大,遮挡关系需要重新计算,原位置不能留残影,外观和纹理还得保持原样——任何一个环节出错,画面就会立刻穿帮。
每一步都关乎三维空间的物理常识,而这恰恰是当前图像编辑模型最容易翻车的地方——语义指令它听懂了,但生成出来的三维状态,却常常错得离谱。
针对这一问题,浙江大学ReLER团队提出并开源PhyEdit,用显式3D几何preview指导DiT图像编辑,让模型更准确地处理物体远近、尺度、遮挡和多物体操作。论文已被ACM MM 2026接收。


△PhyEdit与Nano Banana Pro对比
一句话概括:让几何模块负责“搬”,让生成模型负责“画”
PhyEdit的核心流程可以拆成四步:
用户给定待操作物体和三维操作指令(可以是移动或者6DOF);
估计场景深度和相机参数,把物体反投影成三维点云;
在3D空间中移动点云,再投影成目标preview;
将源图、preview和文本一起交给Qwen-Image-Edit backbone,生成最终图像。

△PhyEdit方法总览
preview并不需要看起来像一张完整照片。它只要清楚表达“物体应该在哪里、应该多大、应该挡住谁”,生成模型就可以从源图中恢复纹理和身份,把粗糙几何修成自然结果。
因此,PhyEdit避开了两个极端:既不是让大模型完全靠prompt猜三维空间,也不是把点云投影直接当成最终图像。
再补一层深度监督
模型生成的画面“看着像”并不代表目标深度正确。PhyEdit在基础flow-matching loss之外,加入像素级SILog depth loss:先从预测velocity恢复编辑图,再比较编辑图和目标图的深度。
消融结果很直接:不使用深度监督:DIoU 62.37、Chamfer 24.52;latent-to-depth:DIoU 64.19、Chamfer 20.87;pixel-level方案:DIoU 65.33、Chamfer 18.93。

△深度监督结果
训练数据从哪里来?RealManip-40K
团队构建了RealManip-40K,包含41154对真实场景图像,提供深度、物体mask和代表性三维坐标。

△RealManip-40K数据样例
为了保证图像对中的变化主要来自物体而非相机,数据管线利用3D foundation model的camera token进行聚类,筛选相机近似静止的视频片段。之后再完成目标检测、跟踪、分割、深度估计和三维位移筛选。
RealManip-40K重点覆盖三类难题:明显的远近变化、复杂遮挡,以及多个对象同时操作。
专门造了个3D编辑考场:ManipEval
现有图像编辑benchmark经常只看画质、文本一致性或二维位置。PhyEdit团队进一步构建ManipEval:共200对图像、约320个物体,其中一半为单物体操作,另一半为多物体操作。
它从五个层面考察模型:
2D落点是否准确;
深度是否正确;
重建后的三维点云是否接近目标;
物体身份和画质是否保留;
光照、接触与遮挡是否合理。

△ManipEval定量结果
PhyEdit的主要成绩为:DIoU 65.33、Mask IoU 27.20、Chamfer 18.93、RA-DINO 36.91、Phys-VLM 93.72。
与Nano Banana Pro对比,DIoU提升5.36,Chamfer距离降低6.40,RA-DINO提升2.14。
元股证券:ygzq.hk
△ManipEval定性结果
从结果图看,商业模型常见的问题包括:物体仍留在源位置、只操作了多物体指令中的一部分、把目标放到错误深度,或在遮挡区域改变物体身份。PhyEdit在大幅移动、小尺寸物体以及多人操作等场景中更稳定。
还能把一次编辑变成连续动作
给出一条三维轨迹后,PhyEdit会在轨迹上的多个位置生成关键状态,再由视频模型插值出中间帧。
下面这只机械臂没有出现在训练分布中,仍能沿曲线把红笔移动到纸张左下方。实线边框是PhyEdit直接生成的关键帧,虚线边框是插值帧。

△连续物体初始状态

△连续物体操作
只会搬东西?普通编辑能力也保住了
研究者还测试了改变颜色、材质、图案和添加局部元素等任务。PhyEdit需要一次生成同时完成外观编辑与三维操作,综合成功率为87.5%;Qwen-Image-Edit单独完成普通编辑时为88.8%。
两者只差1.3个百分点,但PhyEdit的三维精度明显更高,说明加入几何控制没有让基础编辑能力大幅退化。

△3D操作与附加编辑
GUI也一起开源
PhyEdit提供交互式前端。上传图片后,用户可以轻松分割并选择多个物体,在三维点云中调整平移和旋转,再生成最终图片。

△PhyEditGUI

不是物理引擎,但向“可交互世界模型”迈了一步
团队对PhyEdit的定位比较克制:它不是完整physics simulator,不会显式计算受力、碰撞和动力学。透明反光物体、极端近景移动以及严重的深度或分割错误仍可能导致失败。
PhyEdit解决的是更具体的问题:当动作已经由用户指定时,如何把一个明确的三维操作渲染成几何合理的视觉状态。这种“显式几何+生成渲染”的组合,为机器人视觉规划、交互式内容和图像状态预测提供了一个可复现的开源起点。
论文链接:https://arxiv.org/abs/2604.07230
项目主页:https://nenhang.github.io/PhyEdit
代码:https://github.com/nenhang/PhyEdit
模型:https://huggingface.co/ruihangxu/PhyEdit
数据集:https://huggingface.co/datasets/ruihangxu/RealManip-40K
一键三连「点赞」「转发」「小心心」
炒股杠杆欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🎓 我们会 (尽量) 及时回复你 :)
🌟 点亮星标 🌟
科技前沿进展每日见配资市场

程浅 发自 凹非寺 AI编程赛道已经卷的人麻木了。 刚刚,Devin的开发商Cognition交出一份新成绩单:年化收入
2026-08-14
记者今天(19号)从市场监管总局发布会获悉股票配资是否真实进交易所,随着民营企业“走出去”步伐加快,海外反垄断合规已成为
2026-08-10
克雷西 发自 凹非寺配资软件官方下载 量子位 | 公众号 QbitAI 马斯克带着Grok 4.6,让SpaceXAI重
2026-08-14
国家卫生健康委今天(5月19日)举行新闻发布会介绍时令节气与健康有关情况。中国医学科学院北京协和医院主任医师李乃适介绍,
2026-08-10
谁能想到股票配资适合短线还是长线,在《妻子的浪漫旅行》里笑得灿烂的伊能静,当初居然是一万个不想来? 配资炒股指南 据 8
2026-08-10