人民日报
文件名称只能说明发布者给出的标识,不能单独证明文档内容。相同名称可能对应不同扫描版本、整理版本、⭐压缩版本或重新命名的文件,甚至可能只是图片合集被打包成PDF。
扫描型古籍PDF的文字识别结果不能直接视为原文。OCR可能把繁体字、异体字、行款、夹注、印章文字和竖排顺序识别错误,尤其容易混淆人名、地名、术语和数字。需要引用原句时,应放大原图逐字核对,并记录PDF页码与图像页序。
文档完整性应通过目录、正文和末页交叉检查,而不能只看文件是否能够正常打开。一个🎉能打开的PDF,仍可能缺少封面、目录、卷末、附录或关键页。
当目录页码与实际页面无法对应时,先区分“PDF页序”和🌅“原书页码”。前者从电子文件第一页开始计算,后者可能从正文、卷首或某一册重新编号,二者混用会造成引用位置错误。
目前只有“香炉避尘篇.pdf”这一名称时,最重要的任务不是盲目下载,而是确认文件身份、检查文件安全性,并判断其是否具备可阅读、可检索和可引用的完整结构。下面的步骤适用于搜索、验真、阅读和保存这类名称不够明确的PDF文献。
PDF出现乱码时,常见原因是字体没有正确嵌入、阅读器解析方式不同,或文字编码与页面语言不匹配。可先更换可信阅读器并关闭不必要的字体替换;如果页面本质上是扫描图,则应直接查看图像层,不要把错误的文字层当作原文。
下载文献文件时,来源页面的透明程度比文件名更重要。可靠页面通常会说明文件来源、版本、文件类型、大小、页数或整理方式,而不是只用夸张标题诱导点击。
保存文献时应同时保留身份信息和版本信息,因为同名文件在不同来源之间可能存在页码、内容和识别结果差异。建议建立一个简单记录,包括文件名称、获取日期、来源说明、文件大小、总页数、封面题名和版本备注。
引用扫描文献时,优先写明卷、篇、原书页码和PDF电子页码;如果文档没有印刷页码,则记录电子页码并补充页面特征,例如“某卷正文后第三页”。引用OCR文字时,应注明文字经过识别,并以页面图像作为核对依据。