Phase 19:多模态与文档 Agent
图片、PDF、音频统一成可引用证据
关键要点
- 不同模态先转换成统一 Evidence,再进入检索和生成流程
- Evidence 至少包含文本、来源、模态和置信度
- 多模态回答必须尽量给出引用,降低不可验证的幻觉
学习目标
- 理解多模态输入为什么需要统一证据层
- 能把图片、PDF、音频结果转换成 Evidence
- 知道引用来源和置信度对多模态回答的重要性
标签:Multimodal · Document AI · OCR · Citation
预计学习时间:40 分钟 | 难度:中级