第 1 周 · 周测
第 1 周测验
CO: CO1 CO8
评分量规: common-four-level
第 2 周 · 周测
第 2 周测验
CO: CO1 CO8
评分量规: common-four-level
第 3 周 · 周测
第 3 周测验
CO: CO1 CO8
评分量规: common-four-level
第 4 周 · 周测
第 4 周测验
CO: CO1 CO2 CO8
评分量规: common-four-level
第 5 周 · 周测
第 5 周测验
CO: CO2 CO8
评分量规: common-four-level
第 6 周 · 周测
第 6 周测验
CO: CO3 CO8
评分量规: common-four-level
第 7 周 · 周测
第 7 周测验
CO: CO3 CO8
评分量规: common-four-level
第 8 周 · 周测
第 8 周测验
CO: CO3 CO8
评分量规: common-four-level
第 9 周 · 周测
第 9 周测验
CO: CO4 CO8
评分量规: common-four-level
第 10 周 · 周测
第 10 周测验
CO: CO4 CO8
评分量规: common-four-level
第 11 周 · 周测
第 11 周测验
CO: CO5 CO8
评分量规: common-four-level
第 12 周 · 周测
第 12 周测验
CO: CO5 CO8
评分量规: common-four-level
第 13 周 · 周测
第 13 周测验
CO: CO4 CO5 CO6 CO8
评分量规: common-four-level
第 14 周 · 周测
第 14 周测验
CO: CO7 CO8
评分量规: common-four-level
第 15 周 · 周测
第 15 周测验
CO: CO7 CO8
评分量规: common-four-level
第 16 周 · 周测
第 16 周测验
CO: CO7 CO8
评分量规: common-four-level
第 1 周 · 作业
从芯片到数据中心架构图
CO: CO1 CO8
评分量规: week-01-architecture-rubric
为一项在线 AI 推理服务设计从用户入口到计算结果返回的基础设施架构。图中必须区分业务数据流、控制/管理流和供电散热保障路径;以编号箭头解释一次正常请求,并推演一个后端进程故障与一个机架级链路/供电故障。所有时效性规格和产品行为均须映射到官方 HTTPS 来源,并由学习者记录自己实际访问或核验日期;课程随附来源中的 verified_on 是作者核验元数据,不能代替学习者记录。跨厂商峰值只记录口径,不作无条件性能排名。
一张可读的架构图(PDF、SVG 或高清图片),覆盖 DNS/CDN(若采用)、负载均衡、交换/路由、NIC、CPU/内存、AI 加速器、存储、BMC/管理网以及供电散热 800–1200 字图解:按编号说明正常请求路径、关键接口、容量或延迟约束,并明确三类线型/颜色图例 两份故障推演表:分别记录触发条件、检测信号、影响范围、流量/资源转移、恢复步骤和残余风险 来源与假设清单:每条官方 HTTPS URL、核验日期、支持的图中声明,以及事实/推断/建议/待实测标签 按 week-01-architecture-rubric 完成四维自评,并列出下一版最优先修订的一项 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
完整性(CO1)请选择 1 未达标 2 发展中 3 达标 4 优秀 概念准确性(CO1)请选择 1 未达标 2 发展中 3 达标 4 优秀 关系表达(CO1)请选择 1 未达标 2 发展中 3 达标 4 优秀 证据(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 2 周 · 作业
VM、容器与裸机可复现实验
CO: CO1 CO8
评分量规: week-02-comparison-rubric
在明确授权的物理 Linux 主机、其上的学习 VM 与 rootless Docker 或 Docker Desktop 容器中运行同一只读任务,比较启动/执行证据、资源、隔离、可移植性与运维边界。先用资产记录与 systemd-detect-virt 等证据确认“裸机”确为物理主机;若没有物理主机,向教师申请实验环境,不得把云 VM 或桌面虚拟化主机冒充裸机。固定输入、线程和 CPU/内存条件,每种环境至少重复三次,注明冷/热状态并保存原始输出、退出码、版本和清理后检查。每条时效性事实须映射官方 HTTPS URL,并由学习者记录自己实际访问日期;课程资源 verified_on 只是作者核验元数据。结论须区分观察、推断和建议,不得由一次耗时外推万能赢家。
环境清单:物理主机、VM、容器各自的 OS/内核、CPU 架构、资源限制、虚拟化检测、QEMU/KVM/Docker 版本、镜像或来宾身份与采集时间 可复现实验包:同一脚本与固定输入、三环境完整命令、冷/热条件、每种至少三次原始结果、退出码和异常记录 证据表:每项观察对应命令输出或文件校验值;每项时效性声明对应官方 HTTPS URL、学习者实际访问日期及事实/推断/建议标签 六维隔离矩阵:逐项比较内核、PID、文件系统、网络、资源控制和管理面,并指出特权、挂载或共享故障域如何改变边界 800–1200 字分析:从性能、隔离、可移植性和运维解释结果,列出不可比项、最强混杂变量、失败观察、适用范围和下一轮实验 清理与自评:逐环境列出停止/删除目标和清理后检查,按 week-02-comparison-rubric 四维独立定级并完成一次修订 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
可复现性(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 证据与来源(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 隔离理解(CO1)请选择 1 未达标 2 发展中 3 达标 4 优秀 权衡与反思(CO1、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 3 周 · 作业
可观测的云原生小应用部署计划
CO: CO1 CO8
评分量规: week-03-cloud-native-rubric
为一个包含 HTTP API、关系数据与静态对象的小应用提交可执行但不要求连接生产的云原生部署计划。方案必须同时说明架构与云服务责任边界、从 commit 到不可变 digest 和运行 revision 的可部署链、metrics/logs/traces 与 SLI 的可观测闭环、最小权限/秘密/网络/数据/资源归属的安全边界,以及不使用易变固定单价的成本驱动和低中高情景。Kubernetes 实验只能在本人专用随机 minikube profile 与 namespace 中进行,使用教师批准的 digest;创建前查重,创建后保存 UID 和 `aiknow.exercise` 标签,二者匹配才精确清理。每条时效性事实附官方 HTTPS URL 和学习者实际访问日期;课程 verified_on 不得代填。
双路径架构图:编号表示用户请求、数据与控制路径,以及 commit—pipeline—artifact—image digest—Deployment revision—SLI 验证链;标出服务/部署模型、责任和至少三个故障域 可部署包:12-Factor 差距表、流水线设计稿、Deployment/Service 与可选 Ingress 清单、配置变量名、readiness、发布并发控制、数据兼容和回滚/前滚步骤 运行证据或教师证据包分析:context/profile、随机 namespace、工具版本、namespace UID、归属标签、镜像 digest、对象条件、事件、EndpointSlice、回环探测和精确清理后检查 可观测性契约:至少两个带单位/窗口/分母的 SLI,有限指标标签与基数上界、脱敏日志字段、trace/span 关系、采样/保留、告警和 runbook 安全评审:身份与最小权限、秘密生命周期、镜像供应链、网络入口、数据分类、遥测隐私、创建失败与所有权不匹配的停止条件 成本意识表:计算、存储、数据库、网络出站、备份、日志/追踪、支持和闲置资源的计费单位、低中高用量情景、预算阈值、官方核验入口与实际访问日期,不复制固定价格 来源、假设与修订记录:逐条区分事实/推断/建议/待验证,映射官方来源,按五维四级量规自评并根据一次同伴反馈完成修订 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
架构与责任边界(CO1)请选择 1 未达标 2 发展中 3 达标 4 优秀 可部署性与恢复(CO1)请选择 1 未达标 2 发展中 3 达标 4 优秀 可观测性与证据(CO1、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 安全与资源所有权(CO1)请选择 1 未达标 2 发展中 3 达标 4 优秀 成本意识与来源(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 4 周 · 作业
电商平台中间件选型与失败路径报告
CO: CO1 CO2 CO8
评分量规: week-04-middleware-rubric
针对一个日订单量快速增长的电商或内容平台,提交一份可复核的中间件选型报告,覆盖关系型数据库、缓存、消息队列、跨服务事务与流量治理五个方面。报告必须按「数据形态与一致性要求 → 吞吐与延迟目标 → 运维与安全边界 → 候选方案」的顺序组织,每个决策分支写明触发条件、放弃其他方案的具体约束理由和回退路径;逐项数据指定一致性模型与可接受的收敛窗口,并说明收敛期间界面显示什么、如何对账;跨服务流程给出补偿序列、幂等键、空补偿处理与人工介入条件;流量治理部分给出灰度分流依据、放量步骤、回滚触发指标与超时重试预算,并完成相容性验算。所有数据库与缓存实验只能在本人授权的本地实例中进行,使用带随机后缀的库名与 key 前缀,实验结束后精确清理并记录清理结果,不得连接生产或共享环境,不得记录真实凭据。每条时效性事实附官方 HTTPS 来源与本人实际访问日期;价格与性能基准不写死数值,改为记录计费单位、成本驱动因素、官方核验入口与低中高三档用量情景。
三层选型决策树:第一层数据形态与一致性、第二层吞吐与延迟、第三层运维与安全边界,叶子为候选方案;至少两条完整分支写明触发条件、放弃理由与回退路径 一致性边界表:库存、支付、订单状态、物流、统计逐项给出一致性模型名称、收敛窗口、窗口内界面表现与对账机制,并标明数值是实测还是假设 事务与补偿设计:跨订单/库存/支付的正常路径与补偿路径图,至少四个失败点的处置动作、重试与退避策略、死信路径、幂等键与空补偿处理 流量治理方案:请求路径图(标出 TLS 终止、认证、限流位置)、灰度分流依据与放量步骤、回滚触发指标与阈值、超时与重试预算表及其相容性验算 实验记录:MySQL 版本与表结构、三份 EXPLAIN 原始输出、Redis 排行榜与旁路缓存的命令序列、缓存穿透与集中过期两组对比数据、随机命名与精确清理证据 易变数字清单:价格、规格、配额、基准逐项给出计费单位或测试条件、官方核验入口、本人访问日期与低中高情景,未核验项明确标记为待验证假设 来源与自评:官方来源逐条映射到具体结论,按四维四级量规自评,并根据一次同伴反馈完成修订记录 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
选型决策(CO2)请选择 1 未达标 2 发展中 3 达标 4 优秀 一致性与事务边界(CO1、CO2)请选择 1 未达标 2 发展中 3 达标 4 优秀 可靠性与恢复(CO1)请选择 1 未达标 2 发展中 3 达标 4 优秀 证据与来源(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 5 周 · 作业
数据平台选型、分层建模与治理方案
CO: CO2 CO8
评分量规: week-05-data-platform-rubric
为一个业务主题(如电商订单或内容浏览)提交一份数据平台方案,覆盖规模判断、架构选择、分层建模、批流取舍与数据治理五个部分。先给出数据总量、日增量、单次查询扫描量、延迟目标与并发数五个数字并标明来源;再为三个不同需求(离线报表、近实时看板、实时决策)分别用延迟目标、迟到与重算需求、口径回溯要求、团队运维能力四组约束做出批流选择,每个选择必须同时写出代价与改变触发条件。分层部分给出贴源、明细、汇总、应用四层表清单,每层写明职责边界与不该做的事,并为至少三个指标写出可被他人独立复算的口径定义。治理部分给出一条端到端血缘链路、四类可自动执行的质量规则及其阈值与失败处置、敏感级别分类与审计日志字段。所有实验只能在本人授权的本地环境或教师证据包中进行,使用带随机后缀的库表名并在结束后精确清理,不得连接生产或共享集群。每条时效性事实附官方 HTTPS 来源与本人访问日期;性能数字必须附数据规模、版本与执行计划,不得引用无条件的厂商基准。
规模与架构判断:五个关键数字及其来源标注、Lambda 架构三层图(含每层延迟与一致性承诺)、Kappa 改造分析与消息保留期估算依据 批流选择表:三个需求逐一填写四组约束、选择结论、至少两条代价、缓解工作与含具体数值的改变触发条件 分层模型:四层表清单与每层的职责边界和不该做的事,至少三个指标的完整口径定义(统计对象、时间口径、排除条件、计算公式、所属表) 计算实验记录:Spark DataFrame 与 RDD 两种实现的代码、执行计划、shuffle 次数与实测耗时,缓存有效与无效两组对比,分区与全表扫描量对比 流处理实验记录:事件时间窗口实现、两组水位线容忍偏移下的迟到事件数量对比、迟到处置去向、检查点间隔与一次恢复的实测耗时 治理方案:端到端血缘链路图、四类质量规则的定义与阈值、失败阻断与恢复补跑流程、敏感级别分类与审计日志字段清单 来源与自评:官方来源逐条映射到具体结论,按四维四级量规自评,并根据一次同伴反馈完成修订记录 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
规模判断与架构选择(CO2)请选择 1 未达标 2 发展中 3 达标 4 优秀 链路与分层设计(CO2)请选择 1 未达标 2 发展中 3 达标 4 优秀 数据质量与治理(CO2、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 证据与来源(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 6 周 · 作业
机器学习实验协议与评估方案
CO: CO3 CO8
评分量规: week-06-ml-experiment-rubric
选择一个类别不平衡的公开数据集或合成数据集,提交一份完整的机器学习实验报告。报告必须先说明这是不是一个适合机器学习的问题、任务类型、标签定义与时间口径,再给出数据划分方案(时间序列必须按时间切分)与理由。预处理全部封装在管道中,并提交一次故意泄漏的对照实验量化分数虚高幅度。建模部分必须先建立基线,再训练线性模型与树模型各一个,说明调参顺序与参数间的相互作用。评估部分给出混淆矩阵、查准率-查全率曲线与 ROC 曲线,说明在本数据不平衡程度下应以哪条为准;为漏检与误报设定可量化的业务代价(可为假设值但须标明来源),用期望损失扫描并选出工作阈值。所有实验在本人环境中完成,记录随机种子、库版本与数据规模,使结果可复现;结论必须明确区分关联与因果、事实与待验证假设,不得把特征重要性直接表述为业务因果。
问题判断与任务定义:是否适合机器学习的三项前置判断、任务类型、预测对象、时间口径与标签定义,以及定义模糊会造成的具体影响 实验协议:数据划分方案与理由、随机种子、库版本、数据规模与类别分布,管道结构说明(哪些步骤必须在折内拟合) 泄漏对照实验:管道版本与全量预处理版本的交叉验证得分对比、差距量化与成因解释,以及逐特征可得性审查表 建模记录:基线定义与得分、线性模型的正则化对比与共线性检查、树模型的早停调参过程与两组学习率下的树数对比 评估材料:混淆矩阵、手工推导的四个指标、两类曲线及面积、阈值扫描对照表 阈值决策:漏检与误报的代价假设及其来源标注、各阈值下的期望损失计算、工作阈值选择理由与上线后监控方案 来源与自评:官方文档逐条映射到具体结论,按四维四级量规自评,并根据一次同伴反馈完成修订记录 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
实验协议与泄漏防护(CO3)请选择 1 未达标 2 发展中 3 达标 4 优秀 建模与调参(CO3)请选择 1 未达标 2 发展中 3 达标 4 优秀 评估与阈值(CO3、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 证据与表述(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 7 周 · 作业
深度学习训练工程与结构取舍报告
CO: CO3 CO8
评分量规: week-07-deep-learning-rubric
在本人授权的环境中完成一个小规模图像或文本分类任务,并提交一份深度学习实验报告。报告必须包含完整的可复现配置清单(随机种子、框架与加速库版本、数据集版本与划分种子、全部超参数、硬件型号),并说明他人依此如何重跑。训练部分需提交至少三组单变量对照实验:优化器或学习率对比、迁移策略对比(冻结特征提取与微调)、以及一项训练工程改动(如数据加载线程数或混合精度),每组只改动一个变量,并报告同一配置下重复三次的指标区间,据此判断差异是否为真实提升。机制部分需提交手工计算的小规模注意力中间结果、去掉缩放后的权重极化数值、以及有无位置编码时打乱词序的输出对比。最后给出从全连接到注意力的结构演进图,每一步标注引入的先验、解决的问题与新增代价,并为三个不同任务各选一种结构,结合数据量、序列长度与算力预算说明理由。所有数据须为公开或合成数据并记录来源与许可,实验产物保存在本人目录并在结束后清理。
可复现配置清单:随机种子、框架与加速库版本、数据集版本与划分种子、完整超参数、硬件型号,以及重跑步骤说明 训练机制验证:去掉梯度清零与去掉激活函数两组对照的损失曲线与成因解释,评估模式开关对指标与显存的影响记录 优化实验:至少三种优化器在相同种子下的损失曲线、跨四个数量级的学习率扫描记录(标明发散与停滞的量级)、学习率调度前后的验证指标对比 迁移学习实验:冻结特征提取与微调两种策略的准确率、训练时间与显存对比,预处理不一致对照实验的下降幅度,以及从零训练基线 注意力机制验证:手工计算的完整中间结果与框架实现的一致性核对、去掉缩放后的权重分布数值、位置编码有无时打乱词序的输出对比 工程与归因:设备利用率记录与瓶颈判断依据、单变量改动前后的每轮耗时与指标、同配置重复三次的指标区间及真实提升判断 结构演进与选择:演进图(每步三要素齐全)、三个任务的结构选择与放弃理由、数据量/序列长度/算力预算三项约束评估,以及个人实验检查清单 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
机制理解(CO3)请选择 1 未达标 2 发展中 3 达标 4 优秀 训练工程(CO3)请选择 1 未达标 2 发展中 3 达标 4 优秀 可复现性(CO3、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 证据与表述(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 8 周 · 作业
大模型链路评估与检索增强问答方案
CO: CO3 CO8
评分量规: week-08-llm-system-rubric
为一个具体业务场景(如内部制度问答、产品文档助手)提交一份大模型应用方案与实验报告。方案必须先给出模型对照表:至少两个模型、八个维度、每个字段附官方来源位置与本人访问日期,未公开字段标为「未公开」,不得以推测或第三方转述填充,并单列不可同口径比较的字段。词元与成本部分需用目标模型的分词器对三类真实文本实测词元数,据此估算上下文容量与三档用量情景,不得按字符数换算。推理部分需对比至少两种配置(如不同量化位宽或不同批大小)的显存、首词元延迟与吞吐,并用代表业务的样本评估输出质量差异。检索增强部分需搭建最小链路,为不少于十条测试问题记录六个环节的中间结果,分别给出检索召回率与「有正确片段时的回答准确率」,据此判断瓶颈;实现可定位到片段的引用与一致性校验,关键陈述无依据时降级输出。所有实验在本人授权环境完成,使用公开或已脱敏文档,不上传数据到未经授权的第三方服务;最后给出覆盖内容、数据、依赖、成本四类的风险清单与兜底措施。
模型对照表:至少两个模型、八个维度、逐字段来源位置与访问日期、未公开字段标注,以及不可同口径比较字段的单独说明 词元与容量实测:三类文本在两种分词器下的词元数与字符词元比例、基于实测的上下文容量估算与不确定项说明 对齐机制笔记:三阶段流程图(数据来源、优化目标、产出)、奖励劫持的三种表现与检测信号、对齐质量作为选型维度的论证 推理实验记录:两种配置下的显存、首词元延迟与吞吐对比,长输入短输出与短输入长输出两类请求的耗时分布,键值缓存占用的估算与实测对比 量化质量评估:业务样本上的量化前后输出对比方法与结果,显存、吞吐、质量三项的综合取舍结论 检索增强实验:十条测试问题的六环节中间结果表、检索召回率与有正确片段时的回答准确率、片段数量与去重两组对照实验、引用一致性校验实现与降级触发样例 方案与风险:完整链路图、四类约束的数值与来源、三档成本情景、覆盖内容/数据/依赖/成本的风险清单与兜底措施,以及按四维四级量规的自评与一次同伴反馈后的修订记录 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
机制与口径(CO3)请选择 1 未达标 2 发展中 3 达标 4 优秀 推理与成本(CO3)请选择 1 未达标 2 发展中 3 达标 4 优秀 检索增强设计(CO3、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 证据与风险(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 9 周 · 作业
提示、检索与微调的选型与安全工具调用方案
CO: CO4 CO8
评分量规: week-09-prompt-tuning-rubric
为一个具体业务场景(如合同条款问答、工单分类、报告生成)提交一份方案与实验报告。报告必须先建立不少于十条的固定测试集,覆盖典型、边界与已知失败情况,为每条写出可自动判定的期望,并在任何改动前跑出基线。提示部分需提交至少四个版本的通过率对比与失败样例分类统计,并附版本存档与改动原因。微调部分需先写出必要性论证(提示与检索分别尝试到什么程度、为何不足),列出一次性与持续成本,构造不少于五十条结构统一、逐条标注来源的指令样本,并划出不参与训练的评估样本;若条件允许,完成一次低秩适配微调并对比至少两个秩的效果、显存与训练时长;评估集必须同时包含目标任务与通用能力两部分并分别报告分数。工具部分需定义三个工具(两个只读、一个有副作用),在执行侧实现参数校验、权限分级与人工确认,并设置会话步数与成本上限;必须提交越界参数被拒绝、未确认时不执行、超限时停止三类验证记录,以及一次注入式文本(在检索内容中放入指令式文字)被拒绝执行的记录。所有实验在本人授权环境完成,使用公开或已脱敏数据,不得连接生产系统或使用真实凭据。
测试集与基线:不少于十条测试样例及其可自动判定的期望、覆盖说明(典型/边界/已知失败),以及改动前的基线通过率 提示迭代记录:四个提示版本的完整文本、通过率对比、失败样例按原因分类的统计,以及每版的改动原因与存档 微调必要性论证:提示与检索的尝试程度与不足、微调预期解决的问题、一次性成本与持续成本清单(含基础模型升级后重做的代价) 指令数据集:不少于五十条结构统一的样本,逐条标注来源与核对方式,合成数据须标明并附抽样核对结果,独立评估样本单独划分 微调实验记录:完整训练配置(基础模型版本、数据版本与划分、随机种子、全部超参数、硬件),至少两个秩的对比数据,目标任务与通用能力两部分分数的前后对比 工具调用实现:三个工具的定义(用途描述、参数结构、取值范围、必填项)、执行侧校验规则、权限分级与确认机制,以及完整执行留痕 安全验证与选型结论:越界参数拒绝、未确认不执行、超限停止、注入式文本拒绝四类验证记录;三种方案的职责划分、改变触发条件与持续监控方案;按四维四级量规自评与一次同伴反馈后的修订记录 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
评估设计(CO4、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 方案选型(CO4)请选择 1 未达标 2 发展中 3 达标 4 优秀 工具与安全边界(CO4、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 证据与记录(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 10 周 · 作业
AI 服务工具链、可观测性与安全评审方案
CO: CO4 CO8
评分量规: week-10-mlops-rubric
为一个可运行的小型 AI 服务(可复用第 8 周的检索增强应用)提交一份工程化方案与实施记录。环境部分需提交锁文件与重建说明、大文件隔离方案与密钥外置验证。实验部分需实现四类信息的自动记录,提交至少四组运行(含一组失败)与一次横向比较结论,并为最优模型编写含已知限制与不适用场景的模型说明。服务化部分需提交接口实现与压测:覆盖至少四个并发档位,记录首词元延迟与整体延迟的中位数、九十五分位与九十九分位以及吞吐,据此定义含测量窗口与统计口径的服务等级目标;必须包含流式返回、客户端取消传递、四类可区分的错误语义,以及阻塞操作放入线程池前后的并发对比。运维部分需设计三层监控(服务层、数据层、效果层)并注入一次分布偏移验证告警,提交人工抽样评估流程与一轮试评估,以及灰度回滚方案与一次回滚演练耗时。安全部分需绘制数据流图,构造用户输入、检索内容、工具返回三类注入尝试并记录系统行为,对未拦截项补充系统级防御后复验,最后按公开风险清单逐项评审并形成带责任人与时间点的整改清单。全部实验在本人授权环境完成,工具调用指向本地模拟服务,不连接生产、不使用真实凭据。
环境与复现:锁文件与重建说明(含 Python 及必要的驱动运行时版本)、大文件隔离与版本引用方式、密钥外置后的缺失变量报错验证、从笔记本抽出的模块与不少于三条单元测试 实验记录:四类信息自动记录的实现、至少四组运行(含失败组及其原因结论)、一次横向比较的问题与结论、含已知限制与不适用场景的模型说明 服务化与压测:接口实现(输入校验、流式返回、取消传递、四类错误语义)、四个并发档位的延迟分位数与吞吐数据及曲线、延迟拐点位置、阻塞操作放入线程池前后的并发对比 服务等级目标与降级:含测量窗口与统计口径的目标定义、触及上限时的降级策略与开关方式、压测得出的降级阈值依据 三层监控与运维:服务层至少三项、数据层至少三项、效果层至少两项指标及其采集方式与阈值、分布偏移注入的告警触发记录与检测延迟、人工抽样评估流程与一轮试评估结果、灰度回滚方案与演练耗时 安全评审:数据流图(标出全部外部内容入口与模型可触发动作)、三类注入尝试的行为记录与补充防御后的复验、日志敏感信息检查与脱敏方案、按公开风险清单逐项的「是否存在/当前措施/是否已验证」评审表 工具链与改进计划:完整工具链图与各环交付物及可独立判定的验收标准、四问自测结果、分阶段改进计划(每阶段含投入、预期收益与完成判定标准),以及按四维四级量规的自评与一次同伴反馈后的修订记录 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
可复现与可追溯(CO4)请选择 1 未达标 2 发展中 3 达标 4 优秀 服务化与指标(CO4)请选择 1 未达标 2 发展中 3 达标 4 优秀 监控与回滚(CO4、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 安全与证据(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 11 周 · 作业
AI 应用场景设计与边界验证方案
CO: CO5 CO8
评分量规: week-11-ai-application-rubric
从本周六个场景中选择两个,并自选一个未讲过的新场景,提交一份应用设计与验证报告。每个场景都必须先填写四维矩阵(错误代价、可追溯需求、权限敏感度、动作触发),给出取值与判断理由,再由取值推导必需配置,并写明本场景明确排除的能力。对话类场景需提交上下文注入规则表(每轮固定注入、按需检索、永不注入三类)与一段不少于二十轮对话的上下文占用曲线及摘要压缩前后的对比。知识库类场景需实现检索阶段的权限过滤与版本过滤,提交两个角色对同一问题的召回差异记录、作废文档不入上下文的验证,以及版本冲突的处理记录。涉及数据查询的场景需提供字段业务含义与指标口径定义,实现只读副本、表白名单、超时与行数上限,并提交写操作与越表查询被拒绝的记录,界面必须展示生成的查询语句。每个场景都需给出一组互相制衡的度量指标与覆盖边界情况的评估集,并跑一轮记录结果。全部实验在本人授权环境完成,使用公开或已脱敏文档,工具调用指向本地模拟服务,不连接生产系统、不使用真实凭据、不执行真实副作用操作。
四维矩阵与配置推导:三个场景逐一给出四个维度的取值与理由、由此推导的必需配置清单,以及每个场景明确排除的能力 对话场景材料:四要素方案(提示、记忆分层、工具清单、拒答与兜底)、上下文注入规则表、二十轮以上对话的占用曲线、摘要压缩前后对比、三个越界提问的系统行为记录 知识库场景材料:文档权限与版本标注方案、两个角色的召回与回答差异记录、作废文档过滤验证、历史查询例外路径验证、版本冲突处理记录 数据查询场景材料:三张表的字段业务含义与两个指标的完整口径定义及视图、口径歧义问题的确认交互记录、只读与白名单配置、写操作与越表查询的拒绝记录、三个合理性校验触发样例 度量与评估:每个场景的互相制衡指标定义(含可判定口径)、覆盖边界情况的评估集、一轮评估结果,以及典型错误回流为回归用例的记录 新场景落地清单:必需配置、负责人、验收标准、明确排除项,以及上线验证表(每项配置对应的验证方式与预期结果) 来源与自评:官方文档逐条映射到具体设计决策,按四维四级量规自评,并根据一次同伴反馈完成修订记录 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
场景分析与配置推导(CO5)请选择 1 未达标 2 发展中 3 达标 4 优秀 权限与边界(CO5、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 可追溯与版本(CO5、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 度量与证据(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 12 周 · 作业
行业场景 AI 落地方案与护栏验证
CO: CO5 CO8
评分量规: week-12-industry-rubric
选择一个具体行业场景(通信运维、制造质检、金融风控或端侧应用),按「约束—方案—未验证假设」三段式提交一份落地方案,并附本周的实验记录。约束段需覆盖数据、流程、合规与成本四类,每项给出数字或范围并标明来源是实测、访谈还是估计。方案段的每个设计决策必须对应到它解决的具体约束,并包含互相制衡的指标组(不得以单一指标作为成效依据),以及监控、重训与回滚机制。实验部分需至少完成两项:多模态任务的三类可靠性对比与图像注入测试;带四类护栏的自主循环实现与三类失控情形验证;协议服务端的接入、信任清单与注入防御验证;或端侧模型的压缩转换、四项指标实测与转换一致性验证。未验证假设段需逐条列出估计值、尚未在真实环境验证的环节与依赖他方配合的事项,并给出验证计划。全部实验在本人授权环境完成,工具调用与服务端一律指向本地模拟服务,不连接生产系统、不使用真实业务数据与真实凭据。
约束段:数据、流程、合规、成本四类约束逐项的数字或范围与来源标注(实测/访谈/估计) 方案段:设计决策与所解约束的对应表、互相制衡的指标组及其可判定口径、人机分工与自动化边界说明、监控与重训回滚机制 多模态实验(如选):三类任务各五样例的正确率、三档分辨率的占用与延迟对比、两步流程的错误归因统计、图像注入测试与防御 智能体实验(如选):四类护栏实现、十个以上任务的步数与成本分布、三类失控情形的触发记录、两种分解粒度对比、不可逆动作待确认验证 协议接入实验(如选):能力发现记录(资源/工具/提示模板)、服务端信任清单、注入测试与防御复验、可追溯到服务端的调用留痕 端侧实验(如选):压缩前后的体积/延迟/内存/功耗四项对比、格式转换记录与算子问题处理、转换前后输出一致性验证与阈值、端云划分方案 未验证假设与自评:逐条假设及其验证计划、同伴互评记录与修订说明、按四维四级量规的自评 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
约束识别(CO5)请选择 1 未达标 2 发展中 3 达标 4 优秀 护栏与边界(CO5、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 评估与指标(CO5、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 未验证假设与表述(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 13 周 · 作业
企业智能知识助手端到端项目
CO: CO4 CO5 CO6 CO8
评分量规: week-13-capstone-project-rubric
独立完成一个端到端的检索增强知识助手项目,并提交项目说明、实现、部署与测试报告。项目说明必须包含目标、范围、明确排除项(每条附理由)、可判定的成功标准与风险清单。评估集必须在实现之前完成,不少于三十条,覆盖单篇可答、多篇综合与资料中无答案三类,每条标注应命中片段与期望行为。实现要求链路的检索、组装、生成、校验四个环节可单独运行与评估,每完成一环运行一次评估集并记录指标,形成随开发推进的曲线;必须实现召回质量下限的拒答路径与引用一致性校验,并用无答案问题实测阈值。接口与界面需实现输入校验、流式返回、取消传递、四类可区分错误语义,以及引用可查看、四类状态区分展示与用户反馈记录。部署需容器化,配置与密钥外置,分别实现存活与就绪检查,并完成一次回滚演练记录实际耗时。测试需覆盖功能、性能与异常三类,优化按单变量原则进行并记录每轮改动前后的指标。全部工作在本人授权环境完成,使用公开或已脱敏文档,不连接生产系统、不使用真实凭据。报告按五段式撰写,所有数字附测量条件,并单列未达标项、失败案例与未验证事项。
项目说明:目标与使用场景、范围、明确排除项及理由、可判定的成功标准(指标、样本集、目标值)、不少于五项风险及应对方案 数据与评估集:可重复执行的清洗切块脚本与运行统计(文档数、块数、块长分布、噪声清理比例)、不少于三十条三类评估问题及其应命中片段与期望行为、两组切块参数的对比与选择依据 核心实现:四个环节的输入输出定义与测试、逐环评估结果与指标曲线、拒答阈值的实测确定过程、引用一致性校验的触发率与其中真正错误的比例 接口与界面:输入校验与四类错误语义的触发样例、流式返回与取消传递验证、引用可查看与四类状态区分展示的记录、反馈存储结构与五条模拟反馈的三类归因 部署材料:容器构建文件与镜像内容检查、同一镜像两组配置的行为差异验证、两类健康检查的状态验证、回滚演练记录(耗时与版本确认) 测试报告:功能测试四项指标(按问题类型分别统计)、至少三个并发档位的延迟分位数与吞吐及拐点、异常测试逐项行为记录、两轮单变量优化的改动与前后指标及回退记录 项目汇报:五段式报告(问题与目标、方案与关键决策、证据与指标、局限与未验证事项、后续计划)、两到三个失败案例及成因、演示记录与同伴提问清单及据此更新的局限说明 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
范围与标准(CO6)请选择 1 未达标 2 发展中 3 达标 4 优秀 实现与可测性(CO4、CO5、CO6)请选择 1 未达标 2 发展中 3 达标 4 优秀 部署与运维(CO6)请选择 1 未达标 2 发展中 3 达标 4 优秀 证据与汇报(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 14 周 · 作业
AI 硬件产业链分析与三场景选型表
CO: CO7 CO8
评分量规: week-14-hardware-rubric
提交一份 AI 硬件产业链分析与选型报告。分析部分需给出七层产业链图,每层标注关键环节与职责,并为每层提供至少一条可公开查证的信息(附来源链接与本人访问日期),查不到的一律标注为「未找到公开数据」,不得以推测或行业传闻填充;同时指出你判断的瓶颈环节,并把技术门槛、产能约束与生态门槛三类壁垒分开讨论。核算部分需为一个具体模型完成显存容量(权重与键值缓存分项)与访存带宽的估算,与至少两款硬件的公开规格对照,结果写成范围并列出全部不确定项;再为一个千卡规模集群估算 IT 与机房总功率、判断可行散热方式并列出连带改造项。生态评估部分需针对一个具体模型,对两条加速器路线逐项确认算子覆盖、框架适配、工具可用性,并实际迁移一份代码统计改动文件数与行数。最后编制训练集群、在线推理、端侧设备三场景选型表,每场景五到八个判断项,每项含结论、依据与来源四列,依据类型标注为实测、官方文档或待验证;价格、产能与交付周期等易变信息单列一节并标注采购前需重新核验。全部实验在本人授权环境完成,不得连接生产集群或使用未授权的内部资料。
产业链分析:七层图与各层关键环节职责、每层至少一条附来源与访问日期的公开信息、未找到数据的条目如实标注、瓶颈判断及其依据类型 三类壁垒对比:为至少两层分别列出技术门槛、产能约束与生态门槛各一条,说明缓解路径的差异 容量与带宽核算:权重与键值缓存的分项估算过程、合计显存需求范围、目标生成速度反推的带宽需求、与两款硬件公开规格的对照及来源 设施核算:千卡集群的 IT 与机房总功率估算及假设来源、机柜功率密度与可行散热方式判断、连带机房改造项清单、网络与运维需求清单 生态与迁移评估:两条路线的算子覆盖清单与替代方案、框架适配情况与官方文档位置、可用工具与一次实际性能分析结果、代码迁移的改动统计与主要问题 三场景选型表:训练集群、在线推理、端侧设备各五到八个判断项,四列齐全,依据类型逐项标注 易变信息与复核:价格/产能/交付周期单列节(含来源与获取日期、需重新核验标注)、同伴复核记录与分歧点定位、按四维四级量规的自评与修订说明 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
产业链结构与瓶颈判断(CO7)请选择 1 未达标 2 发展中 3 达标 4 优秀 容量、带宽与设施核算(CO7)请选择 1 未达标 2 发展中 3 达标 4 优秀 软件生态与迁移评估(CO7、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 来源与可复核性(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 15 周 · 作业
AI 城市场景设计与项目评估方案
CO: CO7 CO8
评分量规: week-15-ai-city-rubric
为一个中等规模城市(可假设人口与财政规模,但须写明假设)提交一份 AI 城市方案。方案需包含四横两纵总体架构图,每横层写出职责边界、三个典型组件、对外接口以及「本层不应承担的职责」,并为平台层制定能力下沉的准入规则;两条纵向体系需在四层各写出具体落点,其中标准类落点至少一项通过国家标准全文公开系统检索并记录标准号与查询日期,安全类措施须与具体法定要求逐条关联,不得笼统写「符合相关法律法规」。场景部分需用业务痛点、数据可得性、流程清晰度三条判据从候选中选出三个场景并排序,为其中一个场景设计完整闭环:逐环节的输入输出、责任主体与时限,误报标记与回流机制,重复事件聚合规则,以及日均事件量与岗位工作量估算和至少两种控制手段。另需为暴雨内涝这类应急场景补充分级处置动作表与通信中断时的降级方案。评估部分需为每个场景定义两到三项互相制衡的量化成效指标、基线采集方式与时点,并给出区分一次性建设投入与年度运营投入的预算结构。最后编制避坑清单,覆盖数据不通、重建设轻运营、供应商绑定三类问题,为每类写出早期信号与可写入立项或采购文件的条款,需由法务或采购部门确认的表述须明确标注。所有政策与标准引用须给出可回查来源与本人查询日期;未核实的行业说法一律标为待验证。
总体架构:四横两纵架构图、各层职责边界与三个典型组件及对外接口、各层「不应承担职责」清单、平台层能力下沉准入规则 两纵落点:标准规范体系在四层的具体落点(至少一项含标准号与查询日期)、安全保障体系在四层的措施及其与法定要求的逐条关联 场景选择:候选场景按业务痛点、数据可得性、流程清晰度三判据的打分与排序、选定三个场景的理由 闭环设计:选定场景的完整链路图(逐环节输入输出、责任主体、时限)、误报标记机制与回流路径、重复事件聚合规则、事件量与岗位工作量估算及两种控制手段 应急场景:暴雨内涝的感知数据清单(覆盖范围、更新频率、故障影响)、预测方法及其不确定性表达、分级处置动作表(岗位、时限、动作、升降级条件)、通信或电力中断时的降级方案 评估与预算:每场景两到三项互相制衡的成效指标、基线采集方式与时点、区分建设与运营的预算结构及运营占比依据、建设期与运营期各不少于四项的评估指标 避坑清单与自评:三类问题的早期信号与阶段分析、可写入立项或采购文件的条款(需法务确认部分已标注)、一个项目的中期体检结果、按四维四级量规的自评与一次同伴反馈后的修订记录 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
场景闭环设计(CO7)请选择 1 未达标 2 发展中 3 达标 4 优秀 架构与数据治理(CO7)请选择 1 未达标 2 发展中 3 达标 4 优秀 成效度量与运营(CO7、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 合规与可复核(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 16 周 · 作业
智慧政务方案与端到端综合设计
CO: CO7 CO8
评分量规: week-16-digital-gov-rubric
提交一份智慧政务方案,并在此基础上完成一页端到端综合设计。服务流程部分需选一项具体政务服务,梳理完整办理流程,统计材料份数、跑动次数与办结时限三项指标并说明数据来源,逐份材料判断其信息由哪个部门掌握及共享障碍类型。自动办理部分需选一项事项,列出资格判定所需的全部数据项(来源部门、字段定义、更新频率、已知偏差),把政策条款拆解为可核验条件并标出需裁量、须保留人工审核的部分(注明需提交主管部门确认),识别至少两处口径不一致风险,并设计告知、查询、异议三个环节。政策问答部分需搭建原型:文件入库记录文号与效力状态、检索默认只召回现行有效版本、引用可定位到条款并做一致性校验、无依据时拒答并转人工;必须提交过渡期、版本冲突、超出范围三类测试用例的验证结果。智能体部分需定义工具的只读与有副作用分级、实现权限继承操作者本人权限、为有副作用工具设置人工确认,并产出一份完整审计日志,验证它能回答「谁办的、依据是什么、人做了什么判断」。安全部分需梳理完整数据流、完成分类分级、检查出域路径与日志缓存留存并给出整改清单,每项措施与对应法定要求关联。试点部分需为一个事务性场景设计方案,含范围、量化指标与质量底线、支持机制,以及继续、调整、终止三类判据。最后完成一页端到端综合设计:算力底座、数据治理、平台能力、场景应用、成效评估五层的关键决策及其对应约束、层间依赖图与实施顺序、以及单列的未验证假设与验证计划。全部实验在本人授权环境完成,只使用公开政策文本与假设数据,不得使用真实个人信息或未公开的内部材料;所有政策引用须附来源与本人查询日期。
服务流程分析:完整办理流程图、材料份数/跑动次数/办结时限三项指标及来源说明、逐份材料的掌握部门与共享障碍分类、「服务找人」形态设计(数据来源、授权依据、可解释方式、异议渠道) 自动办理设计:数据项清单(来源部门、字段定义、更新频率、已知偏差)、政策条款的可核验条件拆解与裁量部分标注、至少两处口径不一致风险分析、告知与查询与异议三环节设计(含时限与责任部门) 政策问答原型:文件入库记录(文号、发布/生效/失效日期、替代关系)、效力过滤与历史查询例外路径验证、可定位到条款的引用与一致性校验降级样例、过渡期与版本冲突与超范围三类测试用例结果 智能体权限与审计:工具清单与只读/有副作用分级及依据、权限继承实现与一次越权调用被拒记录、有副作用工具的人工确认验证、完整审计日志及其对三个追溯问题的回答 数据安全评审:完整数据流图与出域位置标注、分类分级结果与各级处理要求、出域控制的技术手段设计、日志缓存敏感留存检查与整改清单(措施关联法定要求、含责任人与时限) 试点方案:范围与选择依据及预计样本量、三到四项量化指标与一条质量底线及基线采集方式和时点、支持机制与成本、继续/调整/终止三类判据与评估节点、推广前提条件 端到端综合设计:五层关键决策及其对应约束、层间依赖图与实施顺序及必须提前预留的接口、未验证假设清单(内容、影响、验证方式、预计成本)、按四维四级量规的自评与一次同伴反馈后的修订记录 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
服务流程与规则拆解(CO7)请选择 1 未达标 2 发展中 3 达标 4 优秀 答案可信与效力管理(CO7、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 权限、审计与责任(CO7、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 合规依据与未验证假设(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 4 周 · 阶段项目
阶段项目一:基础设施与云原生架构设计
CO: CO1 CO2 CO8
评分量规: stage-project-04-rubric
综合第 1–4 周内容,为一个包含 HTTP 接口、关系型数据、缓存与异步消息的在线服务,提交一份可复核的基础设施与中间件架构方案。方案必须沿一次真实请求画出端到端路径,区分业务数据流、控制与管理流、以及供电散热保障,并标出至少三个共享故障域及其失效影响;中间件部分按「数据形态与一致性要求 → 吞吐与延迟目标 → 运维与安全边界 → 候选方案」分层给出选型决策树,每个分支写明触发条件、放弃其他方案的具体约束理由与回退路径;逐项数据指定一致性模型与可接受的收敛窗口,跨服务流程给出补偿序列、幂等键与空补偿处理;流量治理部分给出灰度分流依据、回滚触发指标与超时重试预算,并完成相容性验算。所有实验只能在本人授权的本地实例中进行,使用带随机后缀的库名与 key 前缀,结束后精确清理并记录结果,不得连接生产或共享环境。每条时效性事实附官方 HTTPS 来源与本人访问日期;价格与性能基准不写死数值,改为记录计费单位、成本驱动因素、核验入口与低中高三档情景。
端到端架构图:一次请求的完整路径,三类路径用不同线型区分,标出至少三个共享故障域及其失效影响与恢复动作 中间件选型决策树:三层结构,至少两条完整分支写明触发条件、放弃理由与回退路径,并对应到具体业务场景 一致性与事务设计:逐项数据的一致性模型、收敛窗口、窗口内界面表现与对账机制,跨服务补偿序列及幂等键与空补偿处理 流量治理方案:请求路径上的 TLS 终止、认证与限流位置,灰度分流依据与放量步骤,回滚触发指标与阈值,超时重试预算及其相容性验算 实验记录:数据库版本与表结构、三份执行计划原始输出、缓存实验的命令序列与穿透及集中过期的对比数据、随机命名与精确清理证据 来源、假设与风险清单:逐条区分事实、推断、建议与待验证假设,官方来源含访问日期,易变数字给出核验入口与三档情景 按四级量规自评请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 8 周 · 阶段项目
阶段项目二:从数据到模型的实验报告
CO: CO2 CO3 CO8
评分量规: stage-project-08-rubric
综合第 5–8 周内容,围绕一个自选任务提交一份从数据到模型的完整实验报告。报告必须先说明这是否是一个适合机器学习的问题、任务类型、标签定义与时间口径,再给出数据划分方案与理由(时间序列必须按时间切分),并说明数据来源与许可。预处理全部封装在管道中,并提交一次故意泄漏的对照实验量化分数虚高幅度;建模部分必须先建立基线,再至少训练两类模型,说明调参顺序与参数间的相互作用,并报告同一配置下重复三次的指标区间,据此判断改动是否为真实提升。评估部分给出混淆矩阵或误差分布、与业务代价匹配的指标,并在类别不平衡时说明为何以查准率-查全率曲线为准。若任务涉及大模型,需补充词元与上下文容量的实测、以及至少两种推理配置的显存、延迟与质量对比。所有实验在本人授权环境完成,记录随机种子、库版本与数据规模使结果可复现;结论必须区分关联与因果、事实与待验证假设,不得把特征重要性直接表述为业务因果。
问题判断与任务定义:三项前置判断、任务类型、预测对象、时间口径与标签定义,以及定义模糊会造成的具体影响 数据与协议:数据来源与许可、划分方案与理由、随机种子、库版本、数据规模与类别分布,管道结构说明 泄漏对照实验:管道版本与全量预处理版本的得分对比、差距量化与成因解释、逐特征可得性审查表 建模记录:基线定义与得分、至少两类模型的调参过程与参数相互作用说明、同配置重复三次的指标区间 评估材料:混淆矩阵或误差分布、与业务代价匹配的指标及其选择理由、阈值扫描对照表(如适用) 大模型补充(如适用):三类文本的词元实测与容量估算、两种推理配置的显存/延迟/质量对比与取舍结论 来源与结论:官方文档逐条映射到具体结论,明确区分关联与因果、实测与推断,并列出仍待验证的假设 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
数据与口径(CO2)请选择 1 未达标 2 发展中 3 达标 4 优秀 建模与机制理解(CO3)请选择 1 未达标 2 发展中 3 达标 4 优秀 评估与指标匹配(CO3、CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 证据与表述(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 13 周 · 阶段项目
阶段项目三:企业智能知识助手端到端原型
CO: CO4 CO5 CO6 CO8
评分量规: week-13-capstone-project-rubric
综合第 9–13 周内容,独立完成一个可运行的检索增强知识助手原型并提交完整交付材料。项目说明必须包含目标、范围、明确排除项(每条附理由)、可判定的成功标准与风险清单。评估集必须在实现之前完成,不少于三十条,覆盖单篇可答、多篇综合与资料中无答案三类,每条标注应命中片段与期望行为。实现要求链路的检索、组装、生成、校验四个环节可单独运行与评估,每完成一环记录一次指标;必须实现召回质量下限的拒答路径与引用一致性校验,并用无答案问题实测阈值。接口与界面需实现输入校验、流式返回、取消传递、四类可区分错误语义,以及引用可查看、四类状态区分展示与用户反馈记录。部署需容器化,配置与密钥外置,分别实现存活与就绪检查,并完成一次回滚演练记录实际耗时。测试需覆盖功能、性能与异常三类,优化按单变量原则进行并记录每轮改动前后的指标。全部工作在本人授权环境完成,使用公开或已脱敏文档,不连接生产系统、不使用真实凭据。
项目说明:目标与使用场景、范围与明确排除项及理由、可判定的成功标准、不少于五项风险及应对方案 数据与评估集:可重复执行的清洗切块脚本与运行统计、不少于三十条三类评估问题及其应命中片段与期望行为、切块参数对比与选择依据 可运行原型:四个环节的输入输出定义与测试、逐环评估结果与指标曲线、拒答阈值的实测确定过程、引用一致性校验的触发率与其中真正错误的比例 接口与界面:四类错误语义的触发样例、流式返回与取消传递验证、引用可查看与四类状态区分展示的记录、反馈存储结构与归因统计 部署材料:容器构建文件与镜像内容检查、同一镜像两组配置的行为差异验证、两类健康检查的状态验证、回滚演练记录(耗时与版本确认) 测试报告:功能测试指标按问题类型分别统计、至少三个并发档位的延迟分位数与吞吐及拐点、异常测试逐项行为记录、两轮单变量优化的改动与前后指标及回退记录 部署复盘:未达标项及其原因与改善成本估计、两到三个失败案例及成因归类、下一步计划及其优先级依据 按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
范围与标准(CO6)请选择 1 未达标 2 发展中 3 达标 4 优秀 实现与可测性(CO4、CO5、CO6)请选择 1 未达标 2 发展中 3 达标 4 优秀 部署与运维(CO6)请选择 1 未达标 2 发展中 3 达标 4 优秀 证据与汇报(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 17 周 · 周测
第 17 周测验
CO: CO1 CO3 CO8
评分量规: common-four-level
第 17 周 · 作业
第 17 周工程证据包
CO: CO1 CO3 CO8
评分量规: common-four-level
选择第 17 周两个主题,提交机制图、可复现实验、原始指标、失败案例与选型结论。先说明业务问题和基线,再固定工作负载、模型或数据版本、硬件与软件环境;每轮只改变一个变量,同时记录质量、延迟、资源峰值和异常行为。结论必须列出适用边界、未验证假设、停止条件与可执行回滚路径。
两项技术的机制图与数据流说明,标出输入、状态、计算、输出和外部依赖 可重复执行的实验步骤、配置版本、固定变量、对照组和原始输出 质量、延迟、资源峰值与失败案例对照表,并解释指标冲突 带适用边界、未验证假设、停止条件和回滚路径的选型结论 按四级量规自评请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 18 周 · 周测
第 18 周测验
CO: CO3 CO4 CO8
评分量规: common-four-level
第 18 周 · 作业
第 18 周工程证据包
CO: CO3 CO4 CO8
评分量规: common-four-level
选择第 18 周两个主题,提交机制图、可复现实验、原始指标、失败案例与选型结论。先说明业务问题和基线,再固定工作负载、模型或数据版本、硬件与软件环境;每轮只改变一个变量,同时记录质量、延迟、资源峰值和异常行为。结论必须列出适用边界、未验证假设、停止条件与可执行回滚路径。
两项技术的机制图与数据流说明,标出输入、状态、计算、输出和外部依赖 可重复执行的实验步骤、配置版本、固定变量、对照组和原始输出 质量、延迟、资源峰值与失败案例对照表,并解释指标冲突 带适用边界、未验证假设、停止条件和回滚路径的选型结论 按四级量规自评请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 19 周 · 周测
第 19 周测验
CO: CO4 CO5 CO6 CO8
评分量规: common-four-level
第 19 周 · 作业
第 19 周工程证据包
CO: CO4 CO5 CO6 CO8
评分量规: common-four-level
选择第 19 周两个主题,提交机制图、可复现实验、原始指标、失败案例与选型结论。先说明业务问题和基线,再固定工作负载、模型或数据版本、硬件与软件环境;每轮只改变一个变量,同时记录质量、延迟、资源峰值和异常行为。结论必须列出适用边界、未验证假设、停止条件与可执行回滚路径。
两项技术的机制图与数据流说明,标出输入、状态、计算、输出和外部依赖 可重复执行的实验步骤、配置版本、固定变量、对照组和原始输出 质量、延迟、资源峰值与失败案例对照表,并解释指标冲突 带适用边界、未验证假设、停止条件和回滚路径的选型结论 按四级量规自评请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评
第 19 周 · 结课项目
结课项目:AI 全栈综合方案与答辩
CO: CO1 CO4 CO6 CO8
评分量规: capstone-rubric
综合全课程内容,独立完成一个结课项目并进行五到十分钟的答辩式自述。选题需满足四条:范围可在给定时间内完成、数据可获得且可公开或可脱敏、成效可用具体指标衡量、失败不会造成实际损害;主题可以是一个可运行原型,也可以是一份面向真实场景的完整方案(如 AI 城市或智慧政务专题)。交付内容必须按算力底座、数据治理、平台能力、场景应用、成效评估五层组织,每个关键设计决策标注它所解决的具体约束,并给出层间依赖图与实施顺序,标明哪些能力必须在前一层就预留接口。涉及个人数据或政务数据的方案,需说明分类分级、最小必要如何落实、数据是否离开受控环境及其技术保障,以及日志与缓存的留存与脱敏方案,并把每项安全措施与对应的法定要求关联,需由法务或主管部门确认的表述须明确标注。报告须按五段式撰写:问题与目标、方案与关键决策、证据与指标、局限与未验证事项、后续计划;所有指标数字必须附测量条件,未验证假设单列成节并附验证方式与预计成本。答辩需主动展示两到三个失败案例并解释成因,而不是只呈现成功演示。全部工作在本人授权环境完成,使用公开或已脱敏数据,不连接生产系统、不使用真实凭据;所有引用附可回查来源与本人访问日期,行业传闻一律标注为待验证。
方案或可运行原型:按五层组织的完整设计或可实际运行的系统,每个关键决策标注其解决的具体约束,附层间依赖图与实施顺序 测试证据:功能、性能与异常三类测试结果及其覆盖范围说明,所有指标数字附测量条件(评估集、问题类型、配置) 来源清单:官方文档、标准与政策逐条映射到具体结论,含可回查位置与本人访问日期,未核实内容明确标为待验证 安全与合规材料:数据分类分级、最小必要的落实方式、出域控制与日志脱敏方案,每项措施关联对应法定要求,需法务确认部分已标注 局限与未验证假设:单列成节,逐条写出内容、影响、验证方式与预计成本,并说明本方案不适用的场景 答辩式自述提纲:五到十分钟的讲述结构、两到三个失败案例及成因分析、预设问答与当场答不上来时的如实说明方式 答辩式自述建议时长:5–10 分钟
按四级量规逐维自评;每个维度分别形成其所映射 CO 的直接证据。
底座与约束对应(CO1)请选择 1 未达标 2 发展中 3 达标 4 优秀 方案设计与工作流(CO4)请选择 1 未达标 2 发展中 3 达标 4 优秀 交付完整性与验证(CO6)请选择 1 未达标 2 发展中 3 达标 4 优秀 证据、局限与答辩(CO8)请选择 1 未达标 2 发展中 3 达标 4 优秀 保存本地自评