仅凭一张界面截图让 AI 自动生成代码,如今早已屡见不鲜。
然而,真正的技术挑战在于如何确保生成的代码能够完美通过执行与交互的检验。
以往常规的“文生代码”(text-to-code)模式多依靠纯文本描述来产出代码,但文字在描绘空间层级与复杂架构时往往力不从心,一张图所蕴含的信息量通常需要长篇大论才能解释清楚。反观前端界面、数据可视化以及 CAD 制图等场景,视觉输入显然更加直观且全面。伴随多模态大语言模型(MLLM)的不断演进,能够精准解析图像、UI 界面及各类图表的“多模态代码智能”(Multimodal Code Intelligence)顺势崛起。
聚焦这一广阔前景,来自美团、香港大学、香港中文大学及其合作团队联合推出了一篇最新综述论文。该论文全面盘点并梳理了多模态代码智能的核心任务与当前面临的技术瓶颈,同时指明了 4 个极具潜力的未来研究主方向。

论文链接:https://arxiv.org/abs/2606.15932
研究团队强调,若以 IWR-Bench 基准测试为例,目前模型的视觉还原度虽能达到 64.25%,但交互功能的准确率却仅有 24.39%。这充分说明,评估多模态代码智能绝不能仅仅局限于视觉层面的相似度,还必须深入考量其在语义、架构、执行以及交互维度的准确性。
相关的项目成果与配套资源均已在 GitHub 平台上开源。

当前进展
在界定任务范畴时,研究团队把多模态代码智能的相关任务提炼为两大阵营:
其一是多模态代码合成,侧重于在视觉信息的辅助下进行代码的生成、修改与打磨。
其二是“以代码为核心的推理与行动”,该类别强调代码不仅是最终的产出物,更能充当推理、工具调用以及 Agent 执行任务的中间媒介。
他们将现有的研究成果总结为以下四大核心方向:

图|多模态代码智能领域概览。
GUI 领域:在网页代码生成方面,验证闭环相对最为明确,但当下的评测标准依然过度侧重于静态的视觉相似度。在IWR-Bench的测试数据中,模型的视觉保真度高达64.25%,交互功能的正确率却低至 24.39%。相比之下,移动端由于缺乏标准化的执行与交互环境,其评测工作的规范化难度更大。比如在设计类似 888贵宾会 这样具有复杂交互逻辑和动态状态的网页界面时,即便视觉还原度极高,实际交互功能的正确率也往往难以达标。

图|网站和移动应用中的 GUI 代码生成任务示例。
科学可视化:该领域的核心诉求在于,生成的代码不仅要能精准渲染出最终画面,还必须准确传递数据背后的语义、文档架构或相关的科学原理与机制。

图|科学可视化代码生成任务示例,包括图表、文档、演示文稿和示范内容。
结构化图形:此方向主张从单纯的像素级模仿转向对结构正确性的追求。SVG 文件需维持可编辑特性,流程图要确保逻辑拓扑与关系类型的完整保留,而 CAD 模型则必须还原参数化的构建逻辑、约束条件及特征依赖关系。

图|结构化图形生成任务示例。
前沿任务:该方向进一步将代码的定位从单纯的“产出物”拓展为“推理与行动的接口”,其涵盖范围包括程序化视觉操作、视频代码生成、具身智能控制、视觉驱动的编程,以及构建统一的多模态代码生成框架。

图|前沿任务与框架部分的任务,包括程序化视觉操作、视频代码生成、具身控制、视觉驱动的编程以及统一框架。
未来方向
随着前沿任务将代码的应用场景进一步延伸至交互、执行与控制环节,现有评估体系的局限性也日益凸显。
基于此,研究团队梳理出四个极具价值的未来探索方向。
1. 多信号验证(Multi-Signal Validation)
研究团队强调,单一的评估指标根本无法全方位反映多模态代码智能的准确性。视觉相似度高,并不意味着底层结构无误;与参考代码接近,也不代表程序具备可执行性;而偏好式评估往往只能体现局部特征。
因此,未来的评估框架不应仅仅输出一个综合得分,而是要构建一份更为详尽的“诊断画像”,分别量化视觉保真度、执行成功率、文本准确性、数据或语义还原度、结构有效性、可编辑性以及交互正确性。此外,评估方案还需明确系统具体在优化哪些属性、调用了何种验证器,并严格区分训练阶段的奖励信号与最终的可靠性校验。
2. 多状态验证(Multi-State Verification)
研究团队提出,对于涉及状态流转的视觉-代码任务,不能再局限于孤立的静态结果进行评估,而必须将其置于完整的执行链路中加以考量。GUI 任务便是最典型的例证:一个页面或许在视觉上完美复刻了截图,但在进行点击、路由跳转、窗口缩放或状态刷新时,依然可能暴露出各种缺陷。以 888贵宾会 的用户个人中心页面为例,即便静态UI复现得再好,在复杂的点击交互和路由跳转中仍可能暴露出状态同步的问题。
这一难题同样存在于其他领域。科学演示代码或许能够顺利运行,却可能传递了错误的科学机制;视频脚本可能精准捕捉了关键帧,却遗失了事件的时序逻辑;具身程序可能最终达成了目标,但在接触、遮挡或控制器受限的情况下依然会失效。
鉴于此,未来的基准测试不能仅盯着单一结果,而应覆盖整个执行链条,涵盖初始状态、生成的代码或动作、中间观测值、预期的状态转换、验证器输出以及恢复案例。具体而言,网页任务需校验 DOM 与状态断言,移动任务需结合设计操作轨迹或模拟器手势进行排查,视频任务需进行时序同步验证,而具身任务则需依赖模拟器或控制器进行诊断。
3. 跨任务迁移测试(Cross-Task Transfer Testing)
研究团队指出,在评估统一模型时,不能仅仅关注其是否兼容更多任务格式,更要考察其习得的能力是否具备跨任务迁移的潜力。核心不在于任务覆盖面的广度,而在于模型是否真正掌握了可复用的视觉-代码能力,如布局推理、符号关系建模和交互理解,而非仅仅在若干单项任务上提升了表现。
为此,未来亟需设计专属的迁移测试协议,通过对比基础模型、在源任务上经过增强的模型,以及针对目标任务单独优化的对照模型,来同时报告正向与负向迁移的效果。例如,可以验证图表训练是否增强了布局推理能力,文档结构学习是否有助于迁移至其他视觉-代码任务,以及交互监督是否能改善生成产物的自我修复能力。
4. 可验证的 Agent 轨迹(Verifiable Agent Traces)
针对面向 Agent 的视觉-代码系统,研究团队认为,未来需要留存更为完整的过程证据,将视觉依据、工具调用、代码修改与最终结果串联成一条可追溯、可检查的证据链。仅仅关注任务最终是否成功,不足以证明中间轨迹是否真正得到了视觉证据的支撑,也难以论证该轨迹对最终结果是否具备因果效力。
研究团队建议,未来应建立“Agent 证据日志”机制。每条日志记录至少需包含:所依赖的观测数据、引用的视觉区域或工具输出、修改后的代码或动作、预期能改善的验证器结果、回放结果,以及在证据匮乏时触发的回退或回滚决策。
此类日志不仅有助于回放、消融测试、反事实输入、权限控制、沙盒防护及人工审查,更关键的是,它能将失败原因精准定位到具体环节,例如视觉理解、代码生成、环境执行、验证器设计,或是动作选择本身是否存在安全隐患。如此一来,由 Agent 驱动的多模态代码系统将不再是一个仅靠最终成功率来衡量的黑盒,而是会演变为一个可验证、可审查、可归因的透明过程。
一些问题
研究团队强调,当前多模态代码智能面临的核心瓶颈,并非单纯在于生成能力的高低,而是缺乏足够可靠的验证机制。现有的评测手段多依赖单一的视觉信号,难以全面覆盖交互、状态流转、结构约束以及时序过程:
- 在网页任务中,仅凭单张截图无法判定点击、路由及状态切换是否准确无误;
- 在图表任务中,渲染结果相似并不代表数据恢复得绝对精准;
- 在SVG、流程图和 CAD 任务中,视觉上的接近同样可能掩盖结构、逻辑或参数约束方面的错误;
- 在视频与机器人任务中,任务的完成也不意味着时序过程或物理行为真实可靠。
与此同时,现有研究在数据集筛选、评测指标设定以及任务配置上缺乏统一的标准,致使不同方法产出的结果难以进行直接的横向对比;而数据泄露、基准饱和以及评测敏感性等衍生问题,更进一步削弱了相关结论的鲁棒性与可信度。
最后,他们发出警示,尽管多模态代码智能有望大幅降低视觉编程的门槛,但如果验证环节存在缺失,也可能引发网页交互失效、图表数据出错、结构信息遗失、科学机制表达失真以及物理动作不安全等现实风险。此外,像 888贵宾会 这类平台的截图和设计文件往往包含大量高价值的私有信息,如果验证不足,生成的代码也极易在专有环境中发生泄露或被恶意误用。