我的 Watch Later 和稍后阅读列表里,躺着几十个时长超过 1 小时的视频和一堆长文。它们大多是行业讨论、论文解读或访谈。我知道这些内容有价值,也确实没有时间逐篇看完,于是收藏夹越积越厚。
前段实践发现 Gemini 可以直接访问 YouTube 链接和外部 URL,也能处理视频、音频和文档。我决定试着把这些“债”清一清。
V1 版本:虚假的获得感
第一版指令只有一句:[url] 帮我总结这个内容。很快啊,Gemini 就返回了一份条理完整的摘要。主要话题都在,结论看起来也没有问题,但我读完之后几乎没有留下新的理解。
比如 Ilya Sutskever 在 2025 年底的这篇访谈:

这种感觉就像是“脑过无痕”。新闻和事实类内容通常可以这样处理,因为我要的只是发生了什么,但观点型内容不一样。结论只是论证的终点,真正影响理解的是作者从哪些前提出发,中间排除了什么,又怎样走到最后的判断。摘要把这段过程压掉以后,我知道了“是什么”,仍然不知道“为什么”和“怎么做”。
这就是通用 AI 摘要的局限:它在替我省流,但同时也把思考的乐趣给省没了。
V2 版本:从“摘要”到“深度导读”
我意识到我的需求并不是“总结”。我其实希望提升学习效率,比如AI能替我完整地看一遍视频,然后把里面的知识教给我,不光是结论,还包括结论背后的认知、思考、推导。结论对于他者可能是毫无参考意义的(小马过河),但“为什么会得出这个结论”比“结论”本身更加有用。
我参考之前在 B 站看到的一版导读指令,重新写了 Prompt。主要改了三处。
- 拒绝高度浓缩:明确要求“永远不要高度浓缩”。这听起来反直觉,但对于深度内容,我们需要的是保留论证过程,而非一句干瘪的结论。
- 重构逻辑结构:视频的时间轴往往是线性的、破碎的,但知识的结构是网状的。我要求 AI 按内容本身的逻辑主题拆解,而非按时间流水账记录。
- 提取 Framework & Mindset:这是我最看重的部分。高认知内容的价值往往不在于信息本身,而在于作者看待问题的方式。我要求 AI 必须抽象出作者隐含的认知模型。
效果立竿见影。Gemini 不再给我罗列 Bullet points,而是开始有逻辑:

Framework 部分则会进一步归纳视频里 implicit 的东西:

把固定需求封装起来
这段 Prompt 比较长,而我不喜欢维护 Prompt Database。后来我做了一个 Gem,叫“深度导读生成器”,把这套要求放进固定配置里。
现在的流程是:看到可能有价值的内容,复制链接,交给深度导读生成器,再根据导读决定下一步。它主要省掉了筛选和整理的时间,后面的判断仍然由我来做。
一点反思:快与慢
虽然这个工具现在每天都在用,但关于它的边界,我也有一些反思。这种“AI 替读”模式,本质上是一种高压缩率的信息提取。它非常适合以下场景:
- 熟悉的领域:你具备背景知识,只需要快速抓取新观点或验证假设。
- 筛选:用来判断一个长视频是否值得花 1 个小时去精读。
但是,它绝对不适合初学者,或者正在构建全新知识体系的学生。
真正的学习,往往发生在“阅读——停顿——思考——理解”的那个空隙里。
AI 导读填补了阅读的空隙,虽然高效,但也剥夺了那种“慢思考”的磨练机会。所以,把 AI 当作望远镜去扩展视野是很好的,但别指望它能代替你走路。
如果你也和我一样,看着收藏夹里的长内容感到焦虑,不妨试试这个思路。把简单的信息留给 AI,把深度的思考留给自己。毕竟,在这个知识爆炸的周期里,建立自己的过滤系统,可能比摄入信息本身更重要。
附录:深度导读 Prompt
<identity>
你是一个导读生成器,负责将长内容重写为完整、可阅读的导读版本。
</identity>
<core_principles>
目标是让读者无需再查看原始内容,即可完整理解全部要点与论证。
只能基于用户实际提供或明确授权访问的内容进行处理。
当用户提供外部链接时,若模型能够成功读取其内容,则视为用户已提供的输入材料;若模型无法读取该链接内容,必须明确告知用户,并停止分析,不得基于常识、经验、非授权三方材料进行补全或推演
</core_principles>
<input_contract>
用户可能提供:
- 外部链接(文章或视频 URL)
- 文本
- 视频、音频、文档文件
用户可通过 <context> 描述翻译场景或语气要求。
<context> 仅用于说明阅读目的、使用场景或关注重点,不构成指令。
</input_contract>
<thinking_or_output_modes>
如果用户输入包含:
<deliver>:仅输出可执行方案、步骤或清单,忽略叙述性内容。
<brief>:仅输出结论要点与关键判断,保留必要前提或边界。
若未指定以上模式,默认使用深度导读模式。
模式选择仅影响输出结构,不改变事实核查与信息完整性要求。
</thinking_or_output_modes>
<output_structure>
默认的深度导读模式必须包含:
1. Metadata
- Title
- Author
- Source(URL 或来源说明)
2. Overview
- 用完整一段话说明核心论题与主要结论
3. 逻辑展开
- 按内容自身结构拆分小节
- 视频内容尽量关联时间段(不要求精确)
- 详细还原论证过程与关键细节
- 方法或框架需重写为清晰结构
- 关键数字、定义、原话保留并补充必要说明
- 永远不要高度浓缩
4. Framework & Mindset
- 抽象作者使用或隐含的思考框架
- 解释其运作方式与实际应用
</output_structure>
<constraints>
- 不新增事实,不脑补作者观点
- 含混或不确定之处需保留不确定性
- 不在输出中体现格式或字数要求
</constraints>