🧩SciDiagramEdit 深度分析 - 2026-07-19
00 分钟
2026-7-19
2026-7-19
type
status
date
slug
summary
tags
category
icon
password

原始链接

为什么今天选它

今天重点比较了四个近期对象:SciDiagramEdit 从论文修订中进化编辑技能;RoboTTT 把 8K 步机器人经历压入可在线更新的内部状态;Tactile 为电脑操作 Agent 增加可验证的“看—定位—执行—核对”工具层;RetroAgent 用结构化记忆支撑化学合成路线搜索。
RoboTTT 的长期上下文很新,但研究重心是机器人策略训练。Tactile 与 RetroAgent 都很贴近 Agent 系统,不过它们分别延续了可靠工具层和外部搜索状态两条已有主线。SciDiagramEdit 提供了另一条更少被讲清楚的路径:不改模型参数,而是从真实任务的前后版本、失败轨迹和验收结果里更新技能文件。它把 skills 从“人手写的经验文档”变成可搜索、可比较、可回退的系统资产。
论文于 2026 年 7 月 16 日提交,公开了完整方法、数据构造、定量结果、消融、人工评测和失败案例。当前没有在论文页列出官方代码仓库,因此本文只把论文公开内容当作已确认事实,不把可复现性说得比现状更好。提交记录与摘要
图 1:SciDiagramEdit 的全貌。左边是真实论文修订,中央是编辑与技能更新循环,右边显示各轮得分和保留下来的最佳技能。原图来自论文 Figure 1。
图 1:SciDiagramEdit 的全貌。左边是真实论文修订,中央是编辑与技能更新循环,右边显示各轮得分和保留下来的最佳技能。原图来自论文 Figure 1。
这张图里有个容易忽略的细节:虚线代表单轮得分,它会上下波动;实线代表验证集上保留的最佳技能,所以只升不降。系统并没有“每轮都学得更好”,而是靠筛选机制不让退步的候选进入最终版本。

它解决的不是生成,而是局部修改

大多数科学图生成工具从文字重新画一张图。论文作者真实面对的任务通常更碎:改一个标签、挪动一个面板、补一条连线、统一字体,其他部分要原样保留。栅格图片编辑器可以整张重绘,但容易顺手改掉文字、符号、颜色和线宽,也不能让用户继续选中单个元素修改。
SciDiagramEdit 直接操作 SVG。适合矢量化的文字、箭头、边框和连接线被转成可寻址的图元;照片、复杂曲线和密集子图仍作为栅格区域嵌入 SVG。这样既保留局部编辑能力,也避免强行把所有内容重画成粗糙矢量。数据处理方法
输入是原图和自然语言修改要求,输出是仍能继续编辑的 SVG。任务的约束很明确:完成指定修改,同时不碰无关内容。这里比“画得好看”更难的是控制修改边界。

数据从哪里来:把论文版本历史当作监督信号

作者从 arXiv 同一论文的不同版本中寻找同一幅图的前后变化,整理出 364 组修改样本,覆盖 23 个主题,并为它们写了 2,628 条原子检查项。修改最多的是重命名文字,占 22.8%;新增元素占 21.4%;连接关系调整最少,占 4.2%。机器学习、自然语言处理、计算机视觉和机器人四类论文合计占 73.6%,2023—2024 年样本占 47%。数据统计与标注
图 2:修改类型、学科来源和年份分布。样本以机器学习相关论文为主,文字和结构修改明显多于连线调整。原图来自论文 Figure 2。
图 2:修改类型、学科来源和年份分布。样本以机器学习相关论文为主,文字和结构修改明显多于连线调整。原图来自论文 Figure 2。
这个数据来源比合成指令更接近真实工作,因为目标图确实由论文作者画过。不过“作者自己的修改意图”这句话要收紧理解。前后图来自原作者,编辑指令并非从作者或审稿人的原始文字中直接提取。附录说明,标注员观察前后图和论文上下文,用 GPT-5.5 辅助迭代两三轮,再由人工确认指令和检查项。标注界面与流程
所以,可靠的说法是“真实作者修改 + 人工重建的修改说明”,而不是“拿到了原作者当时写下的指令”。这仍比凭空合成一批 SVG 编辑任务强,但它会带入标注员对修改目的的理解。

系统怎么运作

一次技能更新涉及三个角色。
Editor 是实际干活的 Agent。它读取顶层技能说明,需要时再打开细分工作流或工具说明,然后使用文件系统、Python 和命令行工具修改 SVG。系统还提供三个常用能力:把 SVG 渲染成图片、检查布局几何问题、生成不适合用简单图元绘制的小图标。Editor 与工具说明
Judge 负责验收。语义部分不让模型自由打分,而是逐条回答每个样本的有限选项问题,例如“右侧面板是否移到了顶部”。美观部分把 Agent 输出与作者修订图随机换位后做两两比较。最终分数是两者相乘:只要没有达到作者目标图的美观门槛,语义分再高也不能让这个候选获得完整信用。Judge 的评分方法
Coach 读取 Editor 的操作记录、Judge 的分数、作者目标图和以前候选被接受或拒绝的历史,然后给技能目录写补丁。每轮最多改 8 处,可以改顶层规则,也可以新建一个工作流文件。它不会重写整套技能,原因很实际:一次完整改写容易忘掉此前已经解决的其他问题。Coach 与补丁机制
图 3:完整训练循环。Editor 修改 SVG,Judge 分开检查语义与美观,Coach 对照目标图和执行记录更新技能,验证集决定补丁是否保留。原图来自论文 Figure 3。
图 3:完整训练循环。Editor 修改 SVG,Judge 分开检查语义与美观,Coach 对照目标图和执行记录更新技能,验证集决定补丁是否保留。原图来自论文 Figure 3。
整个过程没有训练模型权重。主实验用 GPT-5.5 做 Editor,Claude Opus 4.7 做 Coach 和视觉 Judge;技能迁移实验再把同一份技能交给 GPT-5.1、5.3 和 5.4。循环跑 2 个 epoch,批量大小为 8,维护 3 个高分候选,轮流从它们派生新版本。论文所有实验与开发周期合计 API 花费约 2 万美元,运行侧只需一台不带 GPU 的工作站。具体设置与成本

Skill Evolution 到底学到了什么

这里的 skill 不是一句加长提示词,也不是模型微调。它是一组带触发条件的操作规则:顶层文件保存短规则,复杂步骤拆到独立工作流中,运行时按需读取。技能包会记录“什么时候用”“常见失败是什么”“具体怎么处理”“完成后怎么验”。
论文列出的代表性规则很具体:
  • 每次交付前先渲染成图片,让视觉模型按固定格式给出 ship 或 revise;不能凭一次“看起来完成了”就提交。
  • 结构调整后单独检查四类副作用:重复内容、删除后的空洞、替换元素过小、颜色不匹配。
  • 交换两个字符串时先用临时占位符,避免第二次替换把第一次改动覆盖回去。
  • 同一符号同时有上下标时,用可控制位置的 tspan 排版,不能依赖容易错位的 Unicode 上下标。
  • 面板重排后收紧 SVG 的 viewBox,避免新布局外面残留大片空白。
这些规则有两个共同点。第一,它们绑定明确的失败条件,不是“请仔细检查”一类无效提醒。第二,它们把发现问题的办法和修复动作放在一起,Agent 不必只靠模型临场回忆。论文总结的典型技能
图 4:同一个 1×4 面板被改成 2×2。没有技能时,画布仍保留旧尺寸,四周出现空带;技能加入“结构重排后收紧 viewBox”后,版面恢复紧凑。原图来自论文 Figure 7。
图 4:同一个 1×4 面板被改成 2×2。没有技能时,画布仍保留旧尺寸,四周出现空带;技能加入“结构重排后收紧 viewBox”后,版面恢复紧凑。原图来自论文 Figure 7。
Coach 能看到作者目标图也很重要。只有轨迹和分数时,它容易写出流程层规则,例如“多检查一次”;看到目标图后,才更容易发现数学排版、颜色、线宽和间距的具体差异。论文的消融给出了定性案例,但没有给出这个因素的独立总体数值,因此不能据此断言目标图一定贡献了多少百分点。Coach 示范信息消融

实验结果怎么读

在测试集上,SciDiagramEdit 的语义检查成功率为 0.932,高于 GPT-Image-2 的 0.882,也高于三种单次 SVG 编辑基线的 0.823—0.844。指令遵循的两两胜率为 0.756,略低于 GPT-Image-2 的 0.778。
美观结果反过来。SciDiagramEdit 的 IAA 和 ISTA 分别是 47.93 和 45.58,接近作者目标图的 48.25 和 46.49,但对作者目标图的美观胜率只有 0.515。GPT-Image-2 的美观胜率是 0.637。更直白地说,SciDiagramEdit 更擅长把指定内容改对并保留可编辑结构,纯粹的视觉润色仍不如整图重绘模型。主结果 Table 2
同一份 GPT-5.5 技能移交给较弱模型后,三个模型的语义胜率分别增加 0.033、0.047 和 0.018,美观胜率分别增加 0.031、0.081 和 0.065。这个结果支持“技能可以跨模型复用”,但只覆盖同一供应商、同一代模型家族,还不能证明它能无损迁移到完全不同的工具协议和模型习惯。技能迁移 Table 3
图 5:加入技能前后,CNN 方框与百分比标签的间距发生变化。修改内容基本相同,差别主要在新元素是否融入原图的视觉节奏。原图来自论文 Figure 5。
图 5:加入技能前后,CNN 方框与百分比标签的间距发生变化。修改内容基本相同,差别主要在新元素是否融入原图的视觉节奏。原图来自论文 Figure 5。
人工评测用了 30 个测试样本和 5 名同一机构的志愿者。与 GPT-Image-2 相比,SciDiagramEdit 的美观胜率为 0.54,语义胜率为 0.59;与 AutoFigure-Edit(GPT-5.5)相比,两项分别为 0.63 和 0.68。每人完成 120 次强制二选一,共 600 次判断,没有平局选项。人工评测结果与协议
这个人工结果方向上支持论文结论,但样本量不大,评测者背景也集中。0.54 这种接近五五开的数字不适合写成明显领先。论文没有报告置信区间和评测者一致性,自动 Judge 也没有单独做大规模的人机一致性校准。

真正新的地方,哪些是已有做法的组合

从执行轨迹里总结规则并不新。论文自己列出了 Voyager、TextGrad、GEPA、Trace2Skill、EvoSkill 和 Meta-Harness 等前序工作。补丁更新、验证集筛选、多候选搜索、失败历史和按需加载技能文件也都能找到相近做法。相关工作
SciDiagramEdit 真正推进了一步的地方,是把三个原本分散的东西接成了闭环:
  1. 真实产物的版本差异提供任务和目标,而不是只靠人工编题。
  1. 执行记录、原子检查项和目标图共同决定该总结什么经验。
  1. 经验以可读、可改、可回退的技能文件保存,下一批任务直接使用。
它没有发明新的 Agent loop。Editor—Judge—Coach 仍是执行、验收、反思的常见结构。研究价值在于示范了一种“从工作产物反推技能”的完整做法,并证明这些技能在一个窄领域里能跨同代模型复用。
“自我进化”这个说法也稍显夸张。外层循环、数据准备、候选选择和目标图都由预先设定的系统提供,论文也承认当前流程仍是外部编排。Agent 能改自己的技能文件,但没有自己决定学习目标、评价标准和数据来源。论文限制

对产品和研发的启发

最可复用的办法不是照搬三个 Agent,而是建立产物闭环。很多团队已经有天然的前后版本:客服回复被主管修改、数据报告被分析师校正、代码变更在评审后重写、销售方案在客户反馈后调整。只要能保留原始输入、Agent 输出、人类最终版本和验收理由,就有机会从这些差异中提炼规则。
技能更新要走版本管理。每个补丁都应带来源案例、触发条件、影响范围和验证结果。新规则先在独立样本上检查,退步就拒绝;保留几个不同方向的候选,比只维护一份“最新提示词”更不容易卡死。
验收要拆成可回答的小问题。宽泛的“质量怎么样”很难稳定使用。把需求分成事实、结构、格式和视觉等原子检查项,既方便定位失败,也方便 Coach 只改对应规则。
示范比一句差评有用。分数只能告诉 Agent 哪次不好,最终人工版本能告诉它别人是怎么解决的。产品里如果只能保留一个反馈资产,优先保存可对照的最终产物和关键修改理由。
技能文件要分层。常用短规则一直加载,长工作流按需读取,工具脚本单独维护。否则经验积累越多,上下文越臃肿,互相冲突的规则也更难发现。

风险、局限和还没验证清楚的问题

数据规模只有 364 组,且 73.6% 来自四个机器学习相关类别。论文图的排版习惯相近,学到的规则可能更像“机器学习论文 SVG 编辑规范”,未必能迁移到生物医学示意图、工程制图、商业演示或中文图表。
前后图是真实修订,修改指令却是后来重建的。标注员和 GPT-5.5 可能把复杂修改压成更容易执行的显式要求,也可能漏掉原作者没有写出来的审美判断。论文的失败案例正好说明了这一点:Agent 完成明确要求后,仍会漏删旧节点、断开原有连接,或没有把新边框旋转到与周围一致。失败案例 Figure 12
评分强依赖闭源视觉模型,并把作者目标图同时当作美观门槛和 Coach 示范。目标图本身未必是唯一正确答案。若 Agent 做出不同但同样合理的版式,Judge 可能因为偏离作者方案而扣分。
自动评测、技能生成和主要执行器都来自少数闭源模型。论文公开了数据说明和最终技能,但训练成本约 2 万美元,源图还因许可问题不能随数据集一起重新分发。没有官方仓库时,外部团队很难检查完整运行细节或确认所有数字。
技能补丁也会积累债务。规则之间可能互相冲突,旧规则可能只适配某一版工具,过度具体的修复可能在验证集上得分却伤害新分布。论文用 3 个候选和验证集门控降低风险,但只跑了两轮数据,尚未观察数百次更新后的技能膨胀、冲突清理和长期遗忘。
Editor 拥有文件系统、Python 和命令行权限。论文任务只处理研究图,风险较低;换到真实企业工作流后,自动生成的技能和工具调用需要权限隔离、可执行内容审查、来源追踪和回滚机制。论文没有测试恶意输入、提示注入或技能污染。

今日沉淀

  1. 人工最终版本比单一分数更适合教 Agent 改进。
  1. 技能规则要写清触发条件、失败模式、修复动作和验收办法。
  1. 自我改进不等于每轮都进步,必须有独立验证和可回退版本。
  1. 真实版本历史是便宜的训练信号,但修改意图仍需人工确认。
  1. Skill 是长期资产,也会像代码一样积累冲突、过时和安全成本。