• 微信

学术排版神器:一键搞定论文格式,告别最后一步排版焦虑

时间:2026-06-03作者:admin分类:排版与出版物设计浏览:96评论:0

这项研究, 是由中国科学院大学、上海人工智能实验室以及上海交通大学联合开展的, 于2026年5月以预印本形式发布, 其论文编号为arXiv:2605.10341, 凡是感兴趣的读者, 可以通过该编号在arXiv平台查阅完整原文。

**研究概要:那个让所有人头疼的"最后一步"**

那些曾提交过学术论文的人, 大概都历经这样一种别样折磨, 代码编写完毕, 实验已然完成, 文章内容也已写完, 然而在截止日期前几小时, 却猛然发觉论文PDF里, 有一张图片莫名不知跑到哪一页去了, 有一个公式溢出了文本框, 参考文献页面底部现半页空白, 或者整篇文章比规定的页码多了一页半, 于是便开始疯狂修改LaTeX源代码, 接着重新编译, 之后查看PDF再次修改代码又复编译, 此循环有时会一直延续至凌晨, 直至精疲力竭或者截止时间来临。

LaTeX是在学术界被极度广泛运用的论文排版系统,它使得科研人员得以撰写出格式合乎规范、公式呈现美观的专业文档。然而, LaTeX具备一个令人烦闷苦恼的特性, 即你所书写编写的源代码能够成功地进行“编译”, 这意味着在电脑能够依据你的代码生成PDF的前提下, 并不等同于这个生成的PDF看上去美观好看或者是契合会议所规定的要求标准 , 图片兴许会飘移到几页之后的地方 排列, 表格或许会宽到超出了页面的边界范围 大小, 段落有可能会被在不合适恰当的位置处遭断开 分割, 最后一页也许会出现有许多大片令人感到尴尬难堪的空白 留白……

这些问题, 当下不存在任何工具能够自动为你处理。现有的辅助工具, 其一要么仅仅能够查看代码以及编译日志, 这就如同仅仅依靠听声音去判别音乐是否动听一样;其二要么是文字版的AI助手, 它会对代码进行修改, 然而根本“看不到”最终的排版效果究竟是怎样的模样。这便是为何那个令人痛苦的“修改代码—编译—查看PDF—再次修改—再次编译”的循环依旧是每位研究者的噩梦。

具备来自中国科学院大学的研究团队参与其中。同时含有上海人工智能实验室的研究团队。还有来自上海交通大学的研究团队。他们共同决定要将这个问题彻底有效地加以解决。他们研发出来了一个被称作PaperFit的值系统。居然实现了让AI能够切实地“看”着PDF文件。进而帮助你来修正排版事务。其情形恰似雇佣了一位经验十分丰盈的出版编辑。这位编辑坐在旁边。全神贯注地一边紧盯着屏幕上所呈现的PDF文件。一边协助你来修改 LaTeX代码。修改完成之后呀 便再次进行编译呀 进而确实认最终呈现的效果。如此反复操作。一直到所有的一切看上去完全符合相关规范要求为止。

**一、排版的"隐形门槛":能编译≠能发表**

拿快递打包举个例子, 那代码成功编译呢, 就如同你把家伙事儿装进了快递箱子, 而且箱子没破, 然而要使得包裹切实能送出去, 还得进行检查, 检查物品有没有放稳, 也就是看看图片有没有出界, 则需检查箱子有没有超重, 即页数有没有超限, 另外要检查包装有没有破损, 意思是排版有没有出错, 且要检查地址有没有写清楚, 也就是格式有没有符合要求, 仅仅是装进箱子那是远远不够的。

, 研究团队将目前所有工具都没法自动处理的这一环节, 正式定名为“视觉排版优化”(Visual Typesetting Optimization, 简称为VTO)。这是一个新的任务定义: 给出一篇LaTeX源代码能够成功编译的学术论文, 靠着反复查看渲染出来的页面图像、更改源代码、再重新编译来查验效果, 最终使这篇论文的PDF在视觉上洁净、整齐, 而且严格契合目标会议或者期刊的页数需求。 ```。

此为何被谓之乃一遭受忽视之关键环节呢? 研究团队进行了一番明晰之梳理: 于文档自动化之整条流水作业线上, 存在诸多工具用以辅助“产出能够编译之LaTeX源文件”, 诸如格式转换工具可将Word文档转变为LaTeX, 文档理解模型能够从PDF里还原LaTeX代码, 大语言模型可依据文字描述径直生成LaTeX框架。这些俱归属于“结构化排版”阶段, 其目标在于使代码能够得以编译。然而, 存在这样一种情况, “能编译的代码”与“可以直接投稿的那样好看的PDF”之间, 存在着一大段距离, 目前是完全依靠人工手动去处理的——而要填补这段空白的, 正是PaperFit。

**二、现有方法为何束手无策:三个根本性缺陷**

为什么现有的工具没办法解决这个问题呢? 研究团队归结根源得出三个方面了, 每一个都仿佛是充当侦探断案时会缺失掉关键环节那样。

首个缺陷是“视觉盲区”, 基于规则的排版工具所给出的信息, 以及编译日志所提供的那些内容, 从本质上来说, 通通都是一维的代码信号, 编译日志能够告知你存在一个“overfull hbox”, 也就是内容宽度超出了文本框, 然而它却讲不明白这种超出对于读者视觉体验所产生的实际影响究竟有多大, 并且也没办法判断某一张图片所处的位置是否对阅读流畅性造成了影响, 更加没办法感知整个页面的空白分布是否会让人觉得别扭, 排版质量本质上属于二维的空间判断, 可是一维的代码以及日志信息根本就不足以支撑这样的判断。

第二个缺陷在于“修复空间无边界”, 系统一旦发现排版问题, 所面临的修复方案数量众多, 多得令人头皮发麻, 并且其中多数属于“伪修复”, 诸如使用`\vspace`强行添加空白、采用`\resizebox`暴力缩小表格、运用`\newpage`强制换页, 这些命令的确能够使代码继续编译, 然而实际上是在掩盖问题或者将问题转移至其他地方, 与此同时还破坏了正常的排版规范。怎样去区分, 那“真正将问题修复掉的方案”以及“把问题隐匿起来的方案”, 这是一种, 需要去凭借专业知识来进行约束的判断。

在所说的各种缺陷之中, 第三个缺陷是“级联效应无法验证”。LaTeX的排版修改存在一个特性, 这个特性特别棘手: 局部的小改动常常会引发全局的连锁反应。比如说,调整了一张图片的宽度, 这一操作就有可能致使三页之后的分页位置出现变化。而分页位置的变化, 又会进一步使得某个原本状态良好的段落突然出现“孤行”的状况。这里所说的“孤行”, 指的是一段话最后一行孤零零地出现在新的一页顶部的那种情况。纯文字AI助手在对代码进行修改的时候, 根本不会去“看”修改之后的PDF呈现出什么样, 故而完全没有办法预先知道或者验证这些级联效应是不是产生了新的问题。

把AI彻底让其真正投入到仿佛是在切实地“看着”进行修改这其中来, 这便是PaperFit的核心理念。

那PaperFit的核心思路呢, 能用一个直观的类推去领会, 它仿佛在模拟一位经验丰富的出版编辑的工作模式, 这位进行编辑工作的人不会单单只是瞅着LaTeX源代码去捉摸最终的呈现效果, 而是会先开展编译从而生成PDF, 接着逐页翻阅, 从中寻觅出有误的地方, 随之前往源代码那里进行有的放矢的修正, 修改毕再次开展编译以此查看效果, 在确认已然修复好之后才会接着处理下一个问题, 这个“审察后而纠错, 改进后加以证实”的封闭进程, 便是PaperFit系统的根本运作模式。

在每一轮工作里, 系统会处理信息, 这些信息来自不同层面, 有四类。在源代码层面, 会提供文档结构、模板配置以及浮动元素环境, 其中图表在LaTeX里被称作“浮动元素”, 原因是其最终位置由系统自动决定, 有可能“漂浮”到和代码位置不一样的地方, 还会提供表格结构, 以及所有被保护对象的数量与位置, 涵盖图片、表格、标题、标签、引用和参考文献。在编译日志层面, 会提供确定好的执行信息, 包含编译是否成功、有没有未定义的命令、有无未解析的引用、是否存在内容溢出警告等。通过PDF文档层面, 会给出文档级别的输出结果, 这其中涵盖了最终所拥有的页数, 页面的排列顺序, 以及浮动元素实际所处的位置。在渲染出来的页面图像层面, 却能够揭示出那些从源代码以及日志中全然无法看出的二维视觉方面的缺陷, 比如稀疏的最后一页, 双栏格式里某一栏存有大片空白, 图表出现堆叠的情况, 表格因超宽而产生问题, 跨页时视觉呈现出不均衡等状况。

PaperFit将所有排版方面的缺陷整理成一个有着五类划分的分类体系, 当中的第一类是空间运用方面的问题, 涵盖了孤行, 也就是段落的第一行或者最后一行孤零零呈现于一页的顶部或者底部的情况, 还有尾部存在大片空白的现象, 以及双栏格式里两栏不均衡的状况, 另外正文栏内出现意外空洞等情况。第二类是浮动元素所处位置的问题, 包含图表偏离了它在正文中首次被引用的位置过远的情形, 以及图片被缩小得过小或者放大得过大从而超出可用宽度等情况。第三类是表格宽度的问题, 包括表格被过度缩小或者宽度超出文本区域。第四类是溢出问题, 这其中有, 长单词或是URL, 因无法断行从而撑破了文本框, 还有单行公式太宽超出了显示区域。第五类是模板迁移问题, 这里涵盖了, 把论文从一个会议模板换到另一个会议模板时, 图片宽度设置与新模板不匹配, 以及文本区高度改变致使页数超出预算等情况。

**四、修复的艺术:怎么改才是真的"改好了"**

察觉到问题仅仅是起始的那一步, 而究竟怎样去修复才是实实在在的具有高难度的挑战。针对PaperFit, 研究团队谋划出了一整套严谨的“修复偏好档案”, 对能予以施行的事项、受到约束的事项、绝对禁止施行的事项作出了明确的规定。

修复动作被区分为三个等级, 其中, 第一级称作“排版原生修复”, 这是最为推荐采用的方案, 具体包括对浮动元素位置参数予以重新调整, (LaTeX 里像‘这样的参数决定了图表优先出现的位置), 将过长公式拆解成多行, 运用适应宽度的表格环境处理过宽表格, 把图片宽度归一化至契合模板规范的数值, 这些操作直接化解了问题根源, 并且不会产生副作用。

第二级称作“间距调整”, 它是属于那种有条件才被允许的操作, 具体包括局部`\vspace`间距进行精细调整、`\setlength`参数予以修改、栏间分隔给出提示。这各类操作唯有在具备明确理由的情形下才会被准许使用, 并且还一定要经过再次验证方可。

第三级称作是“伪修复”, 其被明确地列为主要修复方式会涉及的禁区, 这里明确规定, 对于表格, 不能运用`\resizebox`去进行暴力缩放, 对于页数, 不能借助`\newpage`或者`\pagebreak`来强行对其加以控制性调整, 对于图形, 不能使用`\scalebox`去进行缩放, 并且, 内容是绝对不可以删除的。这些命令从表面上看能够使得问题“消失”, 但实际上, 要么会把问题隐匿起来, 要么会破坏掉排版所遵循的规范, 要么会将问题推至到别的地方去。

就是当所有关于排版层面的修复工作全部完成之后, 然而页数却依旧稍微超出了预算范围, 或是仍然存在少量空白行的情况下, 此时系统才会允许启用一种“最后手段”, 那便是进行有限度的语义润色, 也就是要轻微调整措辞, 像是得把一个冗长的句子表述得更加简洁, 可绝对不能去改变内容、数据、引用或者学术结论的含义。并且这个操作唯有在排版手段已经穷尽之后才能够去使用。

在每一回进行修复以前, 系统都会对全部被保护对象拍摄一张“快照”, 此“快照”用于记录图片的数量与位置、表格的数量与位置、标题的数量与位置、标签的数量与位置、引用的数量与位置以及参考文献的数量与位置。于修复完成之后, 系统会马上核查这些对象是否全都仍然存在、是否出现了跨章节移动的情况、标题是否有被改动。要是存在任何违规现象, 系统会自动回滚至修复之前的状态。

**五、质量验收的关卡:改完不等于完事**

PaperFit于设计方面, 极其关键的一点在于, 每一回进行修改之后, 都必然要历经一个严谨的“验收关卡”, 并非修改完毕便予以放行, 而是需通过验收。

每一轮修复过后, 这个验收机制都会完整执行如下步骤: 重新进行编译, 随后收集日志, 接着解析确定性信号, 也就是错误、引用以及溢出警告, 然后渲染全部页面, 根据四层证据重新生成结构化缺陷记录, 依照缺陷类别和修复偏好档案来执行修复, 再次进行编译和渲染, 最后由“看门人”做出裁决。

1. 看门人会做出三种裁决当中的一种。2. “完成”所代表的是, 所有约束均已通过, 不存在剩余的阻塞性缺陷。3. 具体的要求涵盖这些: 编译达成成功状态, 渲染达成成功状态, 通过逐页的视觉检查, 不存在阻塞级别的缺陷, 页数契合预算, 所有被保护的内容皆是完好无损的。4. “继续”的意思是, 当前状态是安全的, 不过依然存在问题有待处理。5. 需要在系统记录下待处理的下一步行动之后进入到下一轮中。6. “阻塞”表明的是, 当前修复是不安全的或者是不可行的。7. 这种情况下系统需要进行回滚, 并换用另外一种方案。

之所以这个闭环机制是必要的, 是因LaTeX的排版修改极为“非局部”, 一个微小的改动, 或许会在文档很远的地方引发意想不到的连锁反应, 要是不在每次修改后验证全局效果, 极有可能修好了一个问题, 却在三页之后创造了两个新问题。

六、PaperFit - Bench, 是针对这个问题特意打造的考场。

研究团队专门构建了一个标准化测试集, 这个测试集被命名为PaperFit - Bench, 以便进行严格评估, 那必须得是以PaperFit作为参照展开评估, 当然也包括评判所有其他有可能存在的解决方案。

测试集含有200篇论文, 这些论文全都源自arXiv上已发布的学术论文, 覆盖面涉及自然语言处理、计算机视觉、强化学习等人工智能细分领域, 跨越了10种不同的会议模板, 涵盖AAAI、CVPR、ICCV、ECCV、ICLR、ICML、IEEE Transactions、IJCAI、IJCV以及NeurIPS。这些模板同时具备单栏与双栏格式, 页数限定从7页至14页各有不同。平均每篇论文含有6.3张图片, 以及5.3张表格, 如此这般便能确保进行测试并且涵盖足够复杂的浮动元素场景。

构建测试集的方式极为特别, 每个测试案例生成的办法十分特殊, 是对一篇原始论文进行有计划的“扰动”处理后得来的, 而且留存了原始版本用作参照, 扰动有13种具体操作, 它们分属于前面提及的五个缺陷类别。分别来看, “孤行扰动”这般操作为强制产出孤行而截断短段落, “图片超宽扰动”设定图片宽度, 使其超出可用列宽数值, “表格缩放扰动”以`\resizebox`去包裹表格, 致使其过度收缩变窄, “长公式扰动”插入格外宽的公式, 从而触发展示溢出状况, “模板迁移扰动”将论文模板由其中一个会议模板转为另一个会议模板, 比如说由AAAI双栏模板换为ICLR单栏模板, 与此同时保留那些并不合适的图片宽度设置。

测试案例依据难度被划分成三档, 一档是简单的, 其中包含1到2个同时出现的扰动情况, 数量为60篇, 一档是中等难度的, 有3到4个扰动, 数量是80篇, 一档是困难的, 存在5到8个扰动, 数量为60篇, 这三档的比例大约是3:4:3。

研究团队着重特别强调, 这个测试集的设计原则是“真实优先于简单”, 每个案例均是从真实学术论文起始的, 并非人工构造的玩具例子, 即便标注为“简单”的案例也有可能涵盖相当棘手的局部排版问题, 而“困难”案例通常是多种扰动相互交织一块儿, 模板迁移、表格溢出以及页数超限同时呈现出来。

**七、六种对比基线:从最简单到最接近的竞争者**

六种对比方法被那研究团队设计了, 能力有在层层递进之下添加, 是为了能清晰地展示PaperFit每一款项核心组件的一项突出作用。

LaTeX排版优化_视觉排版优化VTO_排版设计 简约

第一种称作“Perturbed”, 也就是将扰动之后的输入, 原封不动地予以提交, 而不进行任何修复。这属于基准线, 其作用是用以衡量扰动自身究竟有多严重。

第二种称作 “RuleLog”, 运用基于规则的确定性修复方式, 仅仅依靠源代码以及编译日志信号, 完全没有使用任何 AI 模型或者视觉反馈。这体现了当下工业界最为常见的自动化排版辅助工具的能力上限。

第三种称作“TextST”, 是单轮纯文字大模型实施修复, 将LaTeX源代码发送给一个大语言模型, 让其进行一次性修改, 不过完全不让它查看渲染后的PDF页面图像, 这展现了文字AI助手在这个任务上所能够达成的成效。

被称作“TextMR”的是第四种类型, 它具备多轮文字以及日志修复的功能。与TextST相比较而言, 它能够允许进行多轮对话, 而且还能够看到编译日志, 然而却依旧不存在视觉反馈, 它能够针对编译错误作出反应, 可是却无法看到页面。

第五种称作"VisualST", 是单轮视觉修复, 给模型同时给予LaTeX源代码以及渲染出来的页面图像, 然而仅有一轮修复机会 , 这对"加上视觉输入但不迭代"所能额外带来的收益进行了测试。

第六种称作“VisualMR”, 是多轮视觉智能体基线, 这是最贴近PaperFit的对比方式, 它能够在固定轮数里反复查看源代码、日志以及页面图像, 还能够直接修复编译错误、渲染问题以及排版问题, 关键区别在于, VisualMR不存在PaperFit的缺陷分类体系, 不存在结构化诊断记录, 不存在修复偏好档案, 不存在回滚机制, 也不存在带有验收标准的质量门控。它所代表的, 是那种有着多轮视觉反馈的通用AI智能体能够达成的状况, 并且不需要借助任何PaperFit专门去设计出来的具有结构化特点的流程。

**八、实验结果:数字背后的真实差距**

评估运用了两套相互补充的指标体系, 程序化指标对技术层面的正确性予以考察, 其涵盖编译是否成功, 渲染是否成功, 页数是否刚好等于目标值(Page hit, 精确命中率), 全部被保护的学术内容是否完整留存, 引用是否均正确解析, 源代码改动幅度是否合理, 以及修改前后文本语义相似度, 这些指标汇总成为一个0到5分的“Program分数”。视觉质量指标, 是将渲染出的页面图像交给视觉语言模型评估, 以此得到分数, 评估维度含缺陷修复程度、约束符合度、视觉质量、是否引入新缺陷、专业观感、空间利用率、浮动元素位置合理性、排版一致性以及视觉均衡性, 汇总成0到5分的“VLM分数”另外还有个“Win率”, 用以衡量有多少比例的案例中, 某方法的输出在视觉上比扰动输入更佳。

最终, 清晰展示各方法差距的数字出现了。直接提交扰动输入 , 也就是 Perturbed 的 , 那 VLM 分数是 1.83 , Win 率为零 , 页数精确命中率为 37.5%。基于规则的工具 , 即 RuleLog , 它把 VLM 分数提升到了 2.18 , Win 率为 38% , 然而编译成功率却从 58%降至为 52% , 这表明规则工具在某些情形下会起到相反的作用。仅一轮的文字模型, 也就是TextST, 其VLM分数是1.85, 胜率为28%, 编译成功率维持在58.5%, 然而Program分数仅2.57, 这表明它虽说没有对内容造成严重破坏, 不过排版方面的改善极为有限。多轮文字加上日志, 即TextMR, 在文字方法里表现最为出色, 其VLM分数为2.16, 胜率达42.5%, Program分数是2.74, 页数命中率为62.3%, 可是视觉质量依旧停留在2分多的水准。在加入单轮视觉也就是VisualST之后, VLM分数呈现为1.87, 胜率是29.5%, 令人感到惊讶的是, 单轮视觉修复后的VLM分数, 和纯文字比起来并没有高出多少, 这表明“有视觉输入”这件事儿本身并不等同于“能修好排版”, 关键之处还在于是不是有着结构化的迭代流程。

编译成功率可达到97.5%表明多轮视觉反馈确实大幅提升了技术可用性的最接近PaperFit的VisualMR是一个分水岭, 其渲染成功率同样为97.5%, VLM分数是2.80, 胜率为65%, Program分数是4.58。然而, 页数精确命中率只存在54.9%, 它意味着将近一半的案例没能被控制在正确页数, 且这里的胜率也仅仅只有65%, 这就是说居然有35%的案例它所改出来的结果在视觉方面并不比原来的扰动版要更好。

PaperFit的有关数字是, 编译成功率为100%, 渲染成功率同样是100%, VLM的分数是3.39, 胜率为89.5%, 对于页数其精确命中率为80.5%, Program分数是4.58, 该分数与VisualMR几乎相同。VLM分数比VisualMR高出0.59分, 胜率比VisualMR高出24.5个百分点, 页数命中率比VisualMR高出26个百分点。两种方法分享同样的底层大语言模型能力, 差距完全根源于PaperFit的结构化诊断、约束修复以及门控验证机制。

此外, 存在一个值得予以留意的细节: 具备的所有方法, 其内容语义之间的相似度, 皆维持在0.97以上, 这可表明这些相关改善, 均源自排版区域范围层面上的修复, 并非借助大量地对内容进行改写, 以此种“变相”路径来实现缩短页数之目的。

**九、换一个大脑:不同AI模型的表现对比**

研究团队对PaperFit工作流程于不同大语言模型底座的表现加以测试, 从中选定了四个模型, 分别是GPT - 5.4、Claude Opus 4.6、DeepSeek - V4 Pro以及MiMo - v2.5 - pro, 在20个具代表性之情势上开展了对照。

结果呈现出一项关键规律, 所有四个模型的VLM分数, 均处于3.52至3.66之间, 差距仅为0.14分。相比较而言, PaperFit与VisualMR相距的0.59分差距, 远远高于不同模型彼此间的差距。也就是说, PaperFit系统结构设计所带来的提升, 要远甚于去选择哪一个大模型, 更为重要。

各种不同的模型相互之间的区别在于存在一些风格方面的差异, 并非体现能力具有优劣之分, 有着这样的情况: 即在一种“修复导向”的维度里, MiMo - v2.5处于领先位置, 具体是所给出的用于表示缺陷解决程度的值为3.90分是此维度里最高的, 表明它在修复缺陷上具有最强的积极性, 同时视觉质量得分是3.85分也是最高的, 并且发表准备度所获成绩为3.80分同样在此维度里是最高的;而GPT - 5.4在一个名为“不引入新缺陷”的维度上测得分值是最高的, 其数值为4.30分, 展现出更为谨慎保守的特点;还有DeepSeek - V4在空间利用率方面得分可达到3.50分处于领先态势, 而且在浮动元素位置这一指标上得分是3.90分同样领先, 在视觉均衡感以成绩3.20分的测度下也是处于最好状态的。这种差异体现的是修复风格而非修复能力,都在可接受范围内。

从按难度分层的角度去看, VLM分数之间的差距, 在每一个难度级别范围之内, 都不会超过0.14分, 并且, 不存在任何一个模型,在全部的三个难度级别上面都是最优的情况, 其中, GPT - 5.4在简单难度以及中等难度这两个层面上处于领先位置, 而DeepSeek - V4 Pro在困难难度层面上分数是最高的。这样一种交叉的模式, 进一步表明了其中的差异是源于随机波动, 而并非是系统性能力方面的差别。

**十、人类评委的裁判:AI打分靠谱吗**

有一个研究团队, 他们另外还请来了真实且是人类的评估者, 针对所有方法产生的输出展开了评分这个行为, 之后又把人类所给出的打分, 跟VLM自动给出的评分做了相关性方面的分析。最终呈现出的结果表明, 斯皮尔曼相关系数是0.8571, 该相关性程度非常之高。这所展现的含义是, VLM打出的分数, 和真实人类的自身感受的吻合度极为高, 运用VLM实行自动评分用来去代替人工评分那是具备可靠性的。在散点图所展示的情况里, PaperFit于人类给出的评分方面是最高的, 在VLM给出的评分方面同样是最高的, 然而Perturbed(也就是未修复输入)在人类给出评分时, 此项是最低的, 在VLM给出评分时, 此项也是最低的, 并且其他方法的相对排列顺序, 在人类给出评分的情形下与在VLM给出评分的情形下, 是完全一样的。

**十一、真实案例的展示:从"一团糟"到"可以投稿"**

以直观方式让人看出其所为的, 是研究团队所展示的那几个典型案例, 而这些案例呈现的正是PaperFit究竟做了些什么。

在一个呈现为CVPR/ICCV格式的论文实例当中, 该实例目标为10页 , 扰动致使多张图表以及表格, 偏离了它们于正文中首次被提及的位置, 距离甚远。其结果是, 扰动版本以及VisualMR的输出里, 均有一页充斥着文字, 这些文字提及了“表格3”、“表格4”以及“图3”, 然而这些图表根本未曾在附近出现 , 读者无从知晓要翻至何处去寻找。PaperFit将这三个浮动元素, 全都调整到了各自首次引用文字的附近 , 并且整篇论文恰好为10页 , 而VisualMR却产生了13页。

有一个IJCAI格式的案例, 目标是8页, 其中因模板迁移导致出现了大片空白并使页数超标。VisualMR能够实现编译渲染成功, 然而最后一页参考文献区域存在大片空白, 致使整篇论文停留在了10页。PaperFit采用的是更紧凑的排版策略, 其最终版本为8页, 且参考文献部分被完整保留。

存在这么一个情况, 处于IEEE格式的案例里, 目标是16页, 在这个案例中, 扰动版本的文档, 于尾部参考文献部分, 出现了页脚错位的状况。VisualMR这个工具, 可以进行重新编译, 然而, 在修改的进程当中, 引入了特别严重的新排版错误, 而且, 还使得文档扩充到了20页。PaperFit这个东西, 把页脚错位给修复好了, 恢复了紧凑的参考文献布局, 文档又变回16页了。

存在两个模板迁移案例, 一个是从AAAI双栏转变为ICLR单栏, 另一个是从ICLR单栏转变为CVPR双栏, 在此情况下, 要是直接去切换模板, 就会致使图片宽度出现严重失配的状况, 浮动元素位置也会变得混乱不堪。然而, PaperFit自动地对图片宽度进行了调整, 使其适配到了新模板的列宽, 还重新去验证并且优化了浮动元素位置, 最终通过了所有的验收检查, 这些检查包括编译、渲染、模板匹配、栏格式以及内容完整性这些方面。

**十二、还没搞定的失败案例:系统的边界在哪里**

研究团队也坦诚地展示了PaperFit失败的案例。

一种失败情形是, 全局页数把控精准程度欠佳。存在一篇ACM Multimedia论文, 其目标设定页数为10页, 然而PaperFit的迭代修复于局部而言具备有效性, 却滋生出多个稀疏的尾页, 最后致使页数达到16页——在本地进行修复得以实现, 但全局页数控制未能达到预期标准。还有另一篇ECCV论文, 目标页数是19页, 最终呈现出20页的结果, 最后末页仅有一张大图以及大片空白空位。哪怕只超出纸面规定页数一页, 这同样构成了一次硬性的失败情况。

还有一类失败的情况是, 视觉方面的缺陷依旧留存着。有一篇ACM Multimedia论文, 它编译成功了, 而且页数 exactly 是10页, 然而那张本该超宽却被裁剪的图片, 始终还是没有修好——它满足了“能够通过的”约束条件, 可实际的视觉问题却并未得到解决。还有一个案例, 更具棘手性, 是一篇ICLR论文, 它编译成功了, 页数也正确, 为13页, 然而渲染出来的页面却是灰色的, 在视觉上完全无效, 这表明仅仅凭借编译成功当作质量指标是远远不够的, 即便如此就算是PaperFit的视觉验证机制, 在这种异常状况下也并未成功捕获问题。

需要未来研究继续突破的几个方向, 被这些失败模式所指向: 具备更精准的全局页数规划能力, 处理超宽单图时拥有更鲁棒策略, 以及拥有对某些视觉渲染异常的更强检测能力。

终究而言, PaperFit所处理的并非是一个新奇的科幻类问题, 而是一个每日都正折磨着数以万计研究者的极为真实的痛楚, 即LaTeX代码能够运行成功, 并不意味着PDF就美观好看, 能够提交, 并不意味着符合相关格式, 而处于这两者之间的那段距离, 如今能够让一个真正是在“看着”进行修改的AI助手来协助你跨越过去。当然, 它并非毫无瑕疵——特别繁杂的多重问题集合依旧会令其困扰, 页数把控偶尔也欠缺精准度——然而从“你仅能凭借自身反复折腾”辗转至“存在一个AI出版编辑为你注视着屏幕”, 这本身已然是相当大的一个跨越。

在下一次论文提交截止时间往前推三个小时的时候, 说不定你没必要再依靠自身熬夜去盯着那个“修改代码、进行编译、查看PDF文档、接着再进行修改”这样的循环了。又或者, 要是你对这项研究存有兴趣的话, 能够透过arXiv:2605.10341去深入知悉完整的技术细节。

Q&A

Q1:PaperFit能处理哪些类型的LaTeX排版问题?

A: PaperFit能处理诸多类LaTeX排版问题, 具体为, 图表位置飘离引用处甚远, 图片存在超宽或者过小的状况, 表格出现超宽或者被过度缩小的情形, 公式或者长单词致使文本框撑破, 还有切换会议模板后图片宽度与页数不匹配的问题, 它借助同时查看源代码、编译日志、PDF文档以及渲染页面图像去发现这些问题, 并非仅仅查看代码或日志。

那么问题二, PaperFit, 和, 普通的, LaTeX编辑, 人工智能, 之间, 存在着, 什么样的, 本质上的, 区别呢?

普通LaTeX编辑AI如文字版GPT或Claude, 修改代码时根本不“看”最终渲染效果, 改完便交差, 无法预判改动所引发的连锁排版变化, PaperFit的本质区别乃是: 每次修改之后都会重新进行编译后重新渲染成页面图像, 逐页检查是否有新问题产生, 从而形成真正的“看—改—验证”闭环, 并且还有一套明确规定哪些修复操作是允许的等, 哪些又是伪修复的约束体系。

问题3: PaperFit - Bench测试集究竟是透过怎样的方式来进行构建的,基于怎样的原因才会需要专门去构建一个全新的测试集?

PaperFit - Bench从arXiv收集了200篇已发表学术论文, 这些论文覆盖10个会议模板, 而后对每篇论文施加带计划的“扰动”操作, 此操作共有13种, 用于制造各类排版缺陷, 并且保留原始版本用作参照。专门构建是有必要的, 因为现有的排版相关测试集情况是这样, 要么只是测试编译是否成功, 要么只是测试局部元素, 像单个公式或表格之类的, 没有任何一个测试集能够同时支持多类型扰动注入, 能够支持基于渲染页面的视觉评估, 能够支持多轮迭代修复, 还能够支持整篇文档级别的全局验证, 而这些恰恰是VTO任务的核心需求。

你可能想看: