课程目录

第 19 周 · 实战

第19周:Agent 与智能应用

把模型接进有状态、可治理的真实应用

周目标:构建可观测、安全且可评估的智能应用链路

课程成果:CO4 CO5 CO6 CO8

已学习 0 / 7 天

本周 7 个学习日

Day 127

Agent Harness

建议时长:60 分钟

本日 CO:CO4 CO5 CO8

本日概要

先说人话:Harness 是把模型变成可运行 Agent 的外壳:组装提示、暴露工具、保存状态、控制循环、处理重试、记录轨迹并执行权限策略。Harness 是把模型变成可运行 Agent 的外壳:组装提示、暴露工具、保存状态、控制循环、处理重试、记录轨迹并执行权限策略。模型负责决策,Harness 负责边界和可恢复性。工具能调用不等于安全。必须做参数校验、最小权限、超时、幂等、预算和人工确认;无限重试会放大费用和副作用。学习Agent Harness时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

5 分钟 · MP3 · 双主持人讲解

B 站讲解

手撕 Claude Code 源码:从零理解 Agent Harness

清华大学计算机系科协 · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释Agent Harness的工作机制
  • 能识别Agent Harness的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:Harness 是把模型变成可运行 Agent 的外壳:组装提示、暴露工具、保存状态、控制循环、处理重试、记录轨迹并执行权限策略。

学习Agent Harness先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

Harness 是把模型变成可运行 Agent 的外壳:组装提示、暴露工具、保存状态、控制循环、处理重试、记录轨迹并执行权限策略。模型负责决策,Harness 负责边界和可恢复性。

分析Agent Harness时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

工具能调用不等于安全。必须做参数校验、最小权限、超时、幂等、预算和人工确认;无限重试会放大费用和副作用。

评价Agent Harness必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把Agent Harness放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估Agent Harness不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘Agent Harness实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的Agent Harness结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把Agent Harness的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为Agent Harness安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果Agent Harness复现失败,就先补证据而不是扩大部署范围。

实践任务

实现一个带只读工具、写操作确认、超时和轨迹日志的最小 Harness。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 实现一个带只读工具、写操作确认、超时和轨迹日志的最小 Harness。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“Agent Harness”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位Agent Harness要解决的瓶颈,并定义可测成功指标

解析:Agent Harness只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“Agent Harness”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为Agent Harness的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:工具能调用不等于安全。必须做参数校验、最小权限、超时、幂等、预算和人工确认;无限重试会放大费用和副作用。

第 3 题

验证“Agent Harness”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为Agent Harness建立未改动基线或对照组;验证Agent Harness时每轮固定其他变量;同时记录Agent Harness的质量、延迟和资源指标

解析:实现一个带只读工具、写操作确认、超时和轨迹日志的最小 Harness。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“Agent Harness”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张Agent Harness概念图并解释五个关键词。

标准任务

实现一个带只读工具、写操作确认、超时和轨迹日志的最小 Harness。

挑战任务

为Agent Harness设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习

Day 128

多 Agent 协作

建议时长:60 分钟

本日 CO:CO4 CO5 CO8

本日概要

先说人话:多 Agent 把搜索、编码、验证等角色拆开并通过消息或共享产物协作。多 Agent 把搜索、编码、验证等角色拆开并通过消息或共享产物协作。它能并行处理独立任务,也能用审查角色降低单一路径盲点。拆分会产生协调成本、上下文丢失、重复劳动和责任不清。任务高度耦合时,一个 Agent 顺序完成可能更快;必须定义交付物、所有权和停止条件。学习多 Agent 协作时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

4 分钟 · MP3 · 双主持人讲解

B 站讲解

OpenClaw 多 Agent 协作保姆级教程来了!

麦冬AI实验室 · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释多 Agent 协作的工作机制
  • 能识别多 Agent 协作的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:多 Agent 把搜索、编码、验证等角色拆开并通过消息或共享产物协作。

学习多 Agent 协作先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

多 Agent 把搜索、编码、验证等角色拆开并通过消息或共享产物协作。它能并行处理独立任务,也能用审查角色降低单一路径盲点。

分析多 Agent 协作时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

拆分会产生协调成本、上下文丢失、重复劳动和责任不清。任务高度耦合时,一个 Agent 顺序完成可能更快;必须定义交付物、所有权和停止条件。

评价多 Agent 协作必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把多 Agent 协作放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估多 Agent 协作不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘多 Agent 协作实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的多 Agent 协作结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把多 Agent 协作的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为多 Agent 协作安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果多 Agent 协作复现失败,就先补证据而不是扩大部署范围。

实践任务

把一个研究任务分别用单 Agent 与三角色流程完成,比较耗时、Token 和错误数。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 把一个研究任务分别用单 Agent 与三角色流程完成,比较耗时、Token 和错误数。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“多 Agent 协作”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位多 Agent 协作要解决的瓶颈,并定义可测成功指标

解析:多 Agent 协作只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“多 Agent 协作”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为多 Agent 协作的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:拆分会产生协调成本、上下文丢失、重复劳动和责任不清。任务高度耦合时,一个 Agent 顺序完成可能更快;必须定义交付物、所有权和停止条件。

第 3 题

验证“多 Agent 协作”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为多 Agent 协作建立未改动基线或对照组;验证多 Agent 协作时每轮固定其他变量;同时记录多 Agent 协作的质量、延迟和资源指标

解析:把一个研究任务分别用单 Agent 与三角色流程完成,比较耗时、Token 和错误数。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“多 Agent 协作”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张多 Agent 协作概念图并解释五个关键词。

标准任务

把一个研究任务分别用单 Agent 与三角色流程完成,比较耗时、Token 和错误数。

挑战任务

为多 Agent 协作设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习

Day 129

Agent 记忆系统

建议时长:60 分钟

本日 CO:CO4 CO5 CO8

本日概要

先说人话:记忆不是把所有对话永久塞回提示词,而是决定写什么、如何索引、何时检索、怎样更新和何时遗忘。记忆不是把所有对话永久塞回提示词,而是决定写什么、如何索引、何时检索、怎样更新和何时遗忘。可分会话状态、长期事实、经历轨迹和可复用技能。错误记忆会反复污染后续决策,过度写入还带来隐私与成本问题。每条长期记忆应有来源、时间、作用域、置信度和删除机制。学习Agent 记忆系统时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

5 分钟 · MP3 · 双主持人讲解

B 站讲解

【B站最全】逼自己7天学会企业级 Agent 记忆系统实战:从 Context 到 Long-term Memory全流程解析,零基础小白也能轻松上手

八方网域_老唐 · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释Agent 记忆系统的工作机制
  • 能识别Agent 记忆系统的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:记忆不是把所有对话永久塞回提示词,而是决定写什么、如何索引、何时检索、怎样更新和何时遗忘。

学习Agent 记忆系统先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

记忆不是把所有对话永久塞回提示词,而是决定写什么、如何索引、何时检索、怎样更新和何时遗忘。可分会话状态、长期事实、经历轨迹和可复用技能。

分析Agent 记忆系统时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

错误记忆会反复污染后续决策,过度写入还带来隐私与成本问题。每条长期记忆应有来源、时间、作用域、置信度和删除机制。

评价Agent 记忆系统必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把Agent 记忆系统放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估Agent 记忆系统不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘Agent 记忆系统实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的Agent 记忆系统结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把Agent 记忆系统的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为Agent 记忆系统安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果Agent 记忆系统复现失败,就先补证据而不是扩大部署范围。

实践任务

实现带来源和过期时间的记忆表,测试冲突更新、租户隔离与删除。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 实现带来源和过期时间的记忆表,测试冲突更新、租户隔离与删除。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“Agent 记忆系统”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位Agent 记忆系统要解决的瓶颈,并定义可测成功指标

解析:Agent 记忆系统只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“Agent 记忆系统”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为Agent 记忆系统的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:错误记忆会反复污染后续决策,过度写入还带来隐私与成本问题。每条长期记忆应有来源、时间、作用域、置信度和删除机制。

第 3 题

验证“Agent 记忆系统”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为Agent 记忆系统建立未改动基线或对照组;验证Agent 记忆系统时每轮固定其他变量;同时记录Agent 记忆系统的质量、延迟和资源指标

解析:实现带来源和过期时间的记忆表,测试冲突更新、租户隔离与删除。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“Agent 记忆系统”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张Agent 记忆系统概念图并解释五个关键词。

标准任务

实现带来源和过期时间的记忆表,测试冲突更新、租户隔离与删除。

挑战任务

为Agent 记忆系统设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习

Day 130

GraphRAG

建议时长:60 分钟

本日 CO:CO4 CO5 CO8

本日概要

先说人话:GraphRAG 先从文档抽取实体和关系,形成图与社区摘要,再结合局部邻域或全局社区回答跨文档问题。GraphRAG 先从文档抽取实体和关系,形成图与社区摘要,再结合局部邻域或全局社区回答跨文档问题。它把检索对象从文本块扩展为结构化关系。抽取错误会沿实体合并、边连接和摘要逐级传播;图并不会自动保证事实正确。构图成本较高,也不适合所有单文档问答。学习GraphRAG时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

4 分钟 · MP3 · 双主持人讲解

B 站讲解

【喂饭教程】20分钟超快速入门GraphRAG,从原理到实战技术精讲,2026最新版,手把手带你从入门到代码实战开发,存下吧,比啃书好太多了!LLM|AI大模型

Agent应用开发 · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释GraphRAG的工作机制
  • 能识别GraphRAG的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:GraphRAG 先从文档抽取实体和关系,形成图与社区摘要,再结合局部邻域或全局社区回答跨文档问题。

学习GraphRAG先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

GraphRAG 先从文档抽取实体和关系,形成图与社区摘要,再结合局部邻域或全局社区回答跨文档问题。它把检索对象从文本块扩展为结构化关系。

分析GraphRAG时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

抽取错误会沿实体合并、边连接和摘要逐级传播;图并不会自动保证事实正确。构图成本较高,也不适合所有单文档问答。

评价GraphRAG必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把GraphRAG放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估GraphRAG不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘GraphRAG实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的GraphRAG结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把GraphRAG的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为GraphRAG安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果GraphRAG复现失败,就先补证据而不是扩大部署范围。

实践任务

用十篇小文档构图,人工抽查实体、边和社区摘要,记录错误传播链。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 用十篇小文档构图,人工抽查实体、边和社区摘要,记录错误传播链。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“GraphRAG”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位GraphRAG要解决的瓶颈,并定义可测成功指标

解析:GraphRAG只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“GraphRAG”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为GraphRAG的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:抽取错误会沿实体合并、边连接和摘要逐级传播;图并不会自动保证事实正确。构图成本较高,也不适合所有单文档问答。

第 3 题

验证“GraphRAG”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为GraphRAG建立未改动基线或对照组;验证GraphRAG时每轮固定其他变量;同时记录GraphRAG的质量、延迟和资源指标

解析:用十篇小文档构图,人工抽查实体、边和社区摘要,记录错误传播链。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“GraphRAG”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张GraphRAG概念图并解释五个关键词。

标准任务

用十篇小文档构图,人工抽查实体、边和社区摘要,记录错误传播链。

挑战任务

为GraphRAG设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习

Day 131

AI 数据工程

建议时长:60 分钟

本日 CO:CO4 CO5 CO8

本日概要

先说人话:AI 数据工程把采集、清洗、标注、版本、质量、血缘和在线反馈连成可复现管道。AI 数据工程把采集、清洗、标注、版本、质量、血缘和在线反馈连成可复现管道。训练集、评估集、向量索引和反馈日志都需要明确快照与数据合同。数据越多不等于越好;重复、泄漏、许可不明和分布漂移会让指标虚高或带来合规风险。删除请求必须能传递到派生数据和索引。学习AI 数据工程时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

5 分钟 · MP3 · 双主持人讲解

B 站讲解

数据质量 第5期:3 步定准需求范围 + 数据血缘梳理

数据治产师 · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释AI 数据工程的工作机制
  • 能识别AI 数据工程的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:AI 数据工程把采集、清洗、标注、版本、质量、血缘和在线反馈连成可复现管道。

学习AI 数据工程先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

AI 数据工程把采集、清洗、标注、版本、质量、血缘和在线反馈连成可复现管道。训练集、评估集、向量索引和反馈日志都需要明确快照与数据合同。

分析AI 数据工程时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

数据越多不等于越好;重复、泄漏、许可不明和分布漂移会让指标虚高或带来合规风险。删除请求必须能传递到派生数据和索引。

评价AI 数据工程必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把AI 数据工程放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估AI 数据工程不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘AI 数据工程实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的AI 数据工程结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把AI 数据工程的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为AI 数据工程安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果AI 数据工程复现失败,就先补证据而不是扩大部署范围。

实践任务

为一个 RAG 数据集建立数据合同、质量检查、版本号、血缘图和删除演练。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 为一个 RAG 数据集建立数据合同、质量检查、版本号、血缘图和删除演练。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“AI 数据工程”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位AI 数据工程要解决的瓶颈,并定义可测成功指标

解析:AI 数据工程只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“AI 数据工程”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为AI 数据工程的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:数据越多不等于越好;重复、泄漏、许可不明和分布漂移会让指标虚高或带来合规风险。删除请求必须能传递到派生数据和索引。

第 3 题

验证“AI 数据工程”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为AI 数据工程建立未改动基线或对照组;验证AI 数据工程时每轮固定其他变量;同时记录AI 数据工程的质量、延迟和资源指标

解析:为一个 RAG 数据集建立数据合同、质量检查、版本号、血缘图和删除演练。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“AI 数据工程”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张AI 数据工程概念图并解释五个关键词。

标准任务

为一个 RAG 数据集建立数据合同、质量检查、版本号、血缘图和删除演练。

挑战任务

为AI 数据工程设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习

Day 132

文档智能

建议时长:60 分钟

本日 CO:CO4 CO5 CO8

本日概要

先说人话:文档智能先识别版面、文字、表格、图片和阅读顺序,再把结构化结果交给检索或业务规则。文档智能先识别版面、文字、表格、图片和阅读顺序,再把结构化结果交给检索或业务规则。扫描件不仅是 OCR,坐标、页码和单元格关系同样决定语义。高 OCR 字符准确率不代表表格和阅读顺序正确。复杂表格、印章、手写、旋转页面和多栏布局必须分别评估,并保留原页证据。学习文档智能时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

4 分钟 · MP3 · 双主持人讲解

B 站讲解

文档智能专题(一):文档智能背景介绍

择数AI · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释文档智能的工作机制
  • 能识别文档智能的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:文档智能先识别版面、文字、表格、图片和阅读顺序,再把结构化结果交给检索或业务规则。

学习文档智能先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

文档智能先识别版面、文字、表格、图片和阅读顺序,再把结构化结果交给检索或业务规则。扫描件不仅是 OCR,坐标、页码和单元格关系同样决定语义。

分析文档智能时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

高 OCR 字符准确率不代表表格和阅读顺序正确。复杂表格、印章、手写、旋转页面和多栏布局必须分别评估,并保留原页证据。

评价文档智能必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把文档智能放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估文档智能不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘文档智能实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的文档智能结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把文档智能的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为文档智能安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果文档智能复现失败,就先补证据而不是扩大部署范围。

实践任务

建立含表格、多栏和扫描噪声的测试集,分别计算文字、字段和表格结构指标。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 建立含表格、多栏和扫描噪声的测试集,分别计算文字、字段和表格结构指标。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“文档智能”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位文档智能要解决的瓶颈,并定义可测成功指标

解析:文档智能只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“文档智能”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为文档智能的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:高 OCR 字符准确率不代表表格和阅读顺序正确。复杂表格、印章、手写、旋转页面和多栏布局必须分别评估,并保留原页证据。

第 3 题

验证“文档智能”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为文档智能建立未改动基线或对照组;验证文档智能时每轮固定其他变量;同时记录文档智能的质量、延迟和资源指标

解析:建立含表格、多栏和扫描噪声的测试集,分别计算文字、字段和表格结构指标。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“文档智能”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张文档智能概念图并解释五个关键词。

标准任务

建立含表格、多栏和扫描噪声的测试集,分别计算文字、字段和表格结构指标。

挑战任务

为文档智能设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习

Day 133

实时语音模型

建议时长:60 分钟

本日 CO:CO4 CO5 CO8

本日概要

先说人话:实时语音链路通常包含流式音频输入、端点检测、ASR 或语音表征、模型推理、增量 TTS 和打断控制。实时语音链路通常包含流式音频输入、端点检测、ASR 或语音表征、模型推理、增量 TTS 和打断控制。体验取决于首音频延迟、持续播放稳定性和用户插话响应。单看 ASR 或 TTS 速度会忽略网络抖动、排队、模型首 Token 与缓冲。打断必须同时停止播放、取消生成并清理状态,权限和录音提示也不可省。学习实时语音模型时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

5 分钟 · MP3 · 双主持人讲解

B 站讲解

号称 95% 准确率?Qwen 实时语音模型实测!

煮茶忘放糖 · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释实时语音模型的工作机制
  • 能识别实时语音模型的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:实时语音链路通常包含流式音频输入、端点检测、ASR 或语音表征、模型推理、增量 TTS 和打断控制。

学习实时语音模型先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

实时语音链路通常包含流式音频输入、端点检测、ASR 或语音表征、模型推理、增量 TTS 和打断控制。体验取决于首音频延迟、持续播放稳定性和用户插话响应。

分析实时语音模型时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

单看 ASR 或 TTS 速度会忽略网络抖动、排队、模型首 Token 与缓冲。打断必须同时停止播放、取消生成并清理状态,权限和录音提示也不可省。

评价实时语音模型必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把实时语音模型放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估实时语音模型不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘实时语音模型实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的实时语音模型结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把实时语音模型的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为实时语音模型安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果实时语音模型复现失败,就先补证据而不是扩大部署范围。

实践任务

搭建流式样机,测首音频、端到端和打断延迟,并注入丢包与背景噪声。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 搭建流式样机,测首音频、端到端和打断延迟,并注入丢包与背景噪声。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“实时语音模型”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位实时语音模型要解决的瓶颈,并定义可测成功指标

解析:实时语音模型只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“实时语音模型”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为实时语音模型的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:单看 ASR 或 TTS 速度会忽略网络抖动、排队、模型首 Token 与缓冲。打断必须同时停止播放、取消生成并清理状态,权限和录音提示也不可省。

第 3 题

验证“实时语音模型”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为实时语音模型建立未改动基线或对照组;验证实时语音模型时每轮固定其他变量;同时记录实时语音模型的质量、延迟和资源指标

解析:搭建流式样机,测首音频、端到端和打断延迟,并注入丢包与背景噪声。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“实时语音模型”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张实时语音模型概念图并解释五个关键词。

标准任务

搭建流式样机,测首音频、端到端和打断延迟,并注入丢包与背景噪声。

挑战任务

为实时语音模型设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习