文件上传与 PDF 阅读
文件处理的第一步是确认内容读对了。扫描 PDF、复杂表格、跨页表格和图像里的小字,可能比普通文本更难解析。支持格式、大小与数量限制,以上传入口提示为准。
上传前整理材料
确认自己有权处理文件,删除无关的个人和商业机密。用能辨认版本的名称,例如 需求说明-2026-09-24.pdf,避免把三份不同材料都命名为“最终版”。
上传完成后,先要求它说明文件主题、章节和读到的范围。抽查开头、中间、结尾各一处,不要直接要求“总结全部”然后相信输出完整。
从结构化摘要开始
请只依据上传的文件回答。
先列出识别到的文件名和主要章节,再整理:结论、关键数字、限制条件。
每条附上原文中的章节标题或可核对的短引文;无法确认页码时不要编造。
未找到的信息写“材料未提供”。
如果文件解析不理想,可以按章节拆分,或在获得授权后提供可选取文本的版本。不要把 OCR 结果天然当作准确原文,尤其要核对金额、日期和否定词。
一次 PDF 阅读的完整示例
假设你上传一份 12 页的培训手册,希望提取报名条件。先让它列出识别到的小节,再指定“报名条件”“费用”“取消规则”三个字段。以下是整理形式示例,不代表真实手册的内容:
| 字段 | 摘录结果 | 核对位置 |
|---|---|---|
| 报名对象 | 以手册明确列出的人员为准 | “报名条件”小节 |
| 费用 | 未找到时写“材料未提供” | 标记是否找到费用章节 |
| 取消规则 | 保留时间限制及例外 | 规则标题与短引文 |
不要要求它为了表格完整而补出一个金额。核对时自己打开 PDF,检查原文的“至少”“不含”“工作日”等条件是否在摘要里保留。页面显示的阅读器页序与正文印刷页码可能不同,应说清引用采用哪一种。
扫描件与跨页表格怎么处理
扫描 PDF 没有可直接选取的文字,识别质量受清晰度、倾斜和版面影响。金额和编号识别错误时,可以裁出原始区域单独检查,并把 OCR 文字与图片对照。裁图要保留表头、单位和必要上下文。
跨页表格先确认后续页面沿用的列名,再提取数据。若表头丢失,“数量”和“金额”可能被放错列。先提取首尾各两行检查字段对应关系,通过后再处理整表。多份文件应分别标注出处,避免把新版主文与旧版附件拼在一起。
对比两份文件
要求按“共同点、差异、冲突、缺失信息”组织。明确以哪份版本为准;如果没有确定版本,要求保留冲突,不要自行融合成一个看似完整的结论。
常见失败与修复
| 现象 | 下一步 |
|---|---|
| 忽略附录或后半部分 | 单独提供该章节,并要求说明读取范围 |
| 数字与原文不一致 | 对照原图或原表,检查 OCR、单位与小数点 |
| 回答包含文件外知识 | 重申只用上传材料,把外部解释单独列出 |
| 上传失败 | 检查文件是否损坏、加密或超出界面限制 |
参考:ChatGPT Learn:Use ChatGPT。相关:数据分析 · 隐私。