Skip to content

修复目录点线数量差异导致文本评分扣分的问题 - #10

Open
liumaker wants to merge 1 commit into
SoMarkAI:mainfrom
liumaker:fix/toc-dot-leader-scoring
Open

liumaker wants to merge 1 commit into
SoMarkAI:mainfrom
liumaker:fix/toc-dot-leader-scoring

Conversation

@liumaker

@liumaker liumaker commented Sep 3, 2026

Copy link
Copy Markdown

问题背景

目录页面通常使用连续句点连接章节标题和页码,例如:

第一章 引言........10
第一章 引言............10

这两条目录在语义上完全相同,差别只是点线长度。

模型生成 Markdown 时,目录点线的句点数量通常不稳定。如果 GT 和预测结果中的句点数量不同,原有文本 NED 会逐字比较这些句点,但是GT的句点个数通常与图片的句点也不相等,从而导致不必要的扣分。

修改内容

  1. 增加目录点线识别规则。
  2. 只识别标题与页码之间连续不少于4个句点的结构。
  3. 支持句点之间带空格的目录点线。
  4. 支持阿拉伯数字页码。
  5. 支持罗马数字页码。
  6. 将符合条件的目录点线规范化为一个空格。

@Soul-Code Soul-Code left a comment

Copy link
Copy Markdown
Contributor

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

这个修复方向有真实数据支持:目录点线长度差异确实会造成不必要的文本评分扣分。

但当前实现会对所有普通文本行执行该正则,缺少 Markdown fenced code 上下文。例如代码块中的 field....10 也会被改成 field 10;同时,仅凭“4 个以上点 + 行尾页码”还不能证明该行一定是目录项,普通正文或代码也可能被误处理。

请修改后再合并:

  1. 保留文档级 fenced code 状态,代码块内容不得进行目录点线归一化;
  2. 尽量把规则限制在可确认的目录行或目录上下文中;
  3. 补充测试:真实目录点线长度差异应被消除;代码块和普通正文中的相似文本必须保持不变。

另外,#10 与 #11 修改了同一文件的相邻逻辑,目前存在合并冲突;其中一个合并后,另一个需要 rebase,或者统一抽成安全的评分归一化流程。

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

2 participants