PROJECT 01

ARGUS AI Reader

可验证的 AI 深度阅读工作台

不是做一个「更会总结的 AI」,而是重新设计 AI 深度阅读中的验证过程。

ROLE

AI Product Lead

TYPE

RAG · 长文档 · Knowledge Tool

SCOPE

Product Definition · RAG Design · Citation System · Evaluation

STATUS

Interactive Prototype

ARGUS AI Reader — 可验证的 AI 深度阅读工作台

Customer Problem

客户问题

通用 AI 阅读工具能够快速总结和回答问题,但在金融、咨询、产品研究、法务等专业阅读场景,真正的问题并不是「得到一个答案」——而是用户能否确认这个答案是否可靠。

章节信息遗漏

长文档无法一次性放入上下文窗口,Chunking 后原有章节结构被破坏,关键信息可能在切分中丢失。

结论无法验证

AI 给出结论但用户无法快速定位原始证据。引用看似存在但无法确认是否真正支持结论。

阅读流程断裂

用户需要反复在 AI 和 PDF 之间手动切换,验证成本极高,最终往往放弃验证。

阅读成果无法沉淀

阅读后的判断、证据和笔记无法长期沉淀为可检索的个人知识,每次重新阅读都是从头开始。

因此产品目标从「AI 帮用户读文档」重新定义为:帮助用户完成 理解 → 验证 → 回到证据 → 形成判断 → 沉淀知识 的完整闭环。

What I Did

我做了什么

我将整个长文档阅读过程拆解为以 Evidence 为中心的产品流程,而不是以 Chat 为中心:

Reliable Parsing → Structure Understanding

保留文档原始章节结构作为 Metadata,不进行无差别 Chunking。章节本身就是理解上下文的重要信息。

Chapter Map-Reduce

先按章节生成摘要、提取事实,再跨章节聚合、检查冲突和评估覆盖率,确保长文档不丢失结构信息。

Citation & Evidence Jump-back

每条回答附带页码、原文片段和来源章节。用户可点击引用直接跳转到 PDF 对应位置。Citation 不只是「显示来源」,而是形成真正的证据回溯闭环。

Active Reading & Knowledge Capture

系统主动提醒未覆盖章节、识别文档中的重要观点和前后矛盾。阅读结果可以转化为笔记、观点卡片和个人知识条目,与原文引用保持关联。

长文档产品流程设计RAG 产品交互设计Citation / Evidence 机制章节 Map-ReduceEvidence Jump-backActive ReadingKnowledge CaptureEvaluation Framework产品原型

Key Decisions

关键决策

DECISION 01

Evidence-first,而不是 Answer-first

为什么

在专业阅读场景中,一个看似合理但无法验证的回答比「不知道」更危险。

决策

没有可靠证据支持时,系统应显示「不确定」或拒绝生成,而不是为了完整回答而猜测。

取舍

系统会更多地说「不确定」,可能降低回答的流畅感,但建立了阅读工具的可信度基础。

DECISION 02

保留文档原始章节结构

为什么

章节结构本身就是理解上下文的重要 Metadata。无差别 Chunking 会破坏学术论文、合同和标书的逻辑结构。

决策

优先保留完整章节边界,Chapter-level Chunking 优先于 arbitrary token-window Chunking。

取舍

某些特别长的章节仍然需要二次切分,但所有 Chunk 保留其所属章节的 Metadata。

DECISION 03

Citation 必须是可点击的证据回路

为什么

用户看到引用后如果还需要手动搜索原文,引用就没有降低验证成本。

决策

Citation 链路:回答 → 原文片段 → 页码 → 对应章节 → PDF 原位置,每层都可点击。

取舍

开发复杂度显著增加,但这是产品区别于通用 Chat 阅读的核心差异。

DECISION 04

把阅读沉淀作为核心能力而非附加功能

为什么

知识工作者的阅读不是一次性消费——阅读后的判断和证据需要长期复用。

决策

Note 和 Knowledge Item 作为一等产品对象,在阅读工作流中直接创建和关联,而非事后保存。

取舍

增加了产品复杂度,但使阅读从「一次性问答」升级为「长期知识积累」。

Results

成果

完成从「答案生成器」到「可验证阅读工作台」的产品重构:

Product

完成 Evidence-first AI Reader 的产品定义与核心工作流。

UX

完成围绕文档、阅读任务、引用和证据的交互体系。

Evaluation

建立引用正确性、覆盖率、长文档遗漏、幻觉率、用户复核成本等评价指标。

Prototype

完成产品原型,展示文档上传、章节导航、RAG 问答、Citation 和 Evidence Jump-back 的交互流程。

当前为交互原型阶段,真实 PDF 解析服务和生产级 RAG 管线属于后续阶段。

Product System

产品系统设计

以 Evidence 为中心的阅读工作流:

1解析与结构
Reliable ParsingStructure Understanding
2理解与索引
Chapter Map-ReduceEmbedding / Index
3检索与验证
RAGCitation VerifyEvidence Jump-back
4主动与沉淀
Active ReadingKnowledge Capture

Evaluation

如何验证

围绕 Evidence-first 原则建立评价体系 —— 目前为 Evaluation Framework:

Evaluation Framework

引用正确性

引用是否指向正确的原文位置,是否存在偏移或捏造。

Evaluation Framework

引用覆盖率

回答涉及的引用是否覆盖了相关章节,是否存在遗漏。

Evaluation Framework

长文档遗漏

关键章节是否在回答中被覆盖,是否存在系统性遗漏。

Evaluation Framework

幻觉率

回答中无引用支持的内容占比,区分模型判断与原文事实。

Evaluation Framework

用户复核成本

用户从看到回答到完成验证所需的时间和点击次数。

Product Demo

产品展示

ARGUS AI Reader — Product Demo加载中...
新窗口

建议在桌面端查看原型,或点击「新窗口」。

正在加载...

Evidence Jump-back —— 回答中的引用可直接返回 PDF 对应页与原始段落,形成完整的证据回溯闭环。

Analysis Framework

产品分析框架

ARGUS AI Reader — Analysis Framework加载中...
新窗口

建议在桌面端查看原型,或点击「新窗口」。

正在加载...

Future State

后续迭代

当前为交互原型阶段。后续需要验证的方向:

  • 接入真实 PDF 解析与 RAG 管线
  • 多文档交叉引用与对比阅读
  • 知识沉淀系统原型
  • 小范围专业用户测试与 Evaluation 校准