OCRmyPDF 元数据指南:如何快速给 PDF 补上标题、作者与关键词

OCRmyPDF 元数据指南:如何快速给 PDF 补上标题、作者与关键词 OCRmyPDF 元数据指南如何快速给 PDF 补上标题、作者与关键词【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF扫描进 PDF 的文件有两个通病全文搜索搜不到字右键看属性也找不到作者信息。OCRmyPDF 在添加 OCR 文本层的同时能把标题、作者、主题、关键词这些元数据一次写入并规范化方便你后续按属性检索文档。️ 30 秒上手一条命令写入元数据假设有一份扫描版文档sample.pdf执行# --title / --author 是元数据参数多词标题要用引号包住 ocrmypdf --title Linzensoup 扫描版 --author 张三 sample.pdf out.pdf跑完之后out.pdf里既有可搜索的文本层文档属性里也多出了标题和作者。注意一个默认行为不传任何元数据参数时OCRmyPDF 会原样复制输入 PDF 的元数据所以老文件里的信息不会丢新字段则是覆盖式写入。参数速查表四个字段一次记牢参数作用示例--title设置文档标题多词需加引号--title 年度报告 2023--author设置文档作者--author 张三--subject设置主题描述--subject 财务审计归档--keywords设置关键词便于检索--keywords 年报,财务,审计--title 传空字符串可显式清空该字段--title 这些参数定义在命令行解析的元数据参数组里见 src/ocrmypdf/cli.py。如果你走 Python API同样是ocrmypdf.ocr(in.pdf, out.pdf, title…, author…)这样的关键字参数名字一一对应。验证用 pdfinfo 确认元数据生效处理完别猜直接查。pdfinfo是 PDF 工具链里查看文件属性的常用命令pdfinfo out.pdf输出中会出现你写入的字段大致长这样Title: Linzensoup 扫描版 Author: 张三 Creator: OCRmyPDF 18.3.0 / tesseract 5.3.4 Producer: pikepdf 9.2.0 ModDate: D:202609011200000000Creator里会带 OCRmyPDF 版本号和处理引擎ModDate自动更新为本次处理时间——这些是自动写入的不需要你操心。批量处理给整个目录统一打标签归档一批文件时用 shell 循环把作者和主题统一刷一遍for f in *.pdf; do ocrmypdf --author 张三 --subject 2023 归档 $f out_$f done跑完整个目录的 PDF 就都带上同一套元数据了。配合-j 4之类的并行参数还能再提速但建议先单跑一个文件确认参数无误。幕后原理速览修复与 PDF/A 标准化元数据不是简单地抄过去有两个值得知道的点元数据修复。GhostscriptPDF 处理引擎在转码时有自己的默认习惯比如输入没写标题就自动填Untitled。OCRmyPDF 在metadata_fixup函数里把这些自作主张改回来缺失的CreateDate等字段也会补齐代码见 src/ocrmypdf/_metadata.py。PDF/A 标准化。输出--output-type pdfa时规范不允许携带的元数据字段会被丢弃OCRmyPDF 会打印类似Some input metadata could not be copied because it is not permitted in PDF/A的提示此时建议去查输出文件的 XMP 元数据确认保留了哪些字段。常见问题Q1不指定--title原标题会被覆盖吗不会。默认行为是复制输入文件的元数据只有你显式传了参数才会覆盖对应字段。Q2为什么输出 PDF/A 后有些字段不见了PDF/A 对元数据字段有白名单限制超出范围的字段的会被移除并输出警告提示。想看实际保留的字段用pdfinfo -meta查看 XMP 部分。Q3能只改元数据、不做 OCR 吗可以加--force-ocr的反向思路——对已有文本层的文件 OCRmyPDF 默认会跳过 OCR 但仍会走元数据修复流程如果纯粹只想改属性用 pikepdf 这类库会更直接。一条命令补全属性、一条pdfinfo验证生效——扫描件从此能按作者和关键词检索了。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考