课程目录

第 1 周 · 初阶

第1周:芯片与服务器基础设施

从硬件底层理解算力来源

周目标:理解芯片架构、服务器组成、计算与存储的基本原理

课程成果:CO1 CO8

已学习 0 / 7 天

本周 7 个学习日

Day 1

芯片基础

建议时长:60 分钟

本日 CO:CO1 CO8

本日概要

从指令集架构、微架构、制造工艺三个层次认识 CPU,并用厂商原始规格建立可比字段。x86、Arm 与 RISC-V 首先是软件可见的指令集及生态选择;流水线、缓存和执行单元属于具体微架构;制程名称描述制造世代,却不能脱离芯片面积、功耗边界、软件和工作负载直接推出性能。摩尔定律可作为历史观察和工程趋势讨论,不是保证性能按固定速度增长的自然定律。

听书与视频

本日听书

6 分钟 · MP3 · 双主持人讲解

B 站讲解

【半导体】B站最全最细的半导体工艺全套教程。从0到1带你彻底了解芯片半导体工艺!包含半导体工艺流程介绍、IC芯片、氧化、沉积工艺、CMP等等及封装工艺圈流程

机械设计教学珺 · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能用硬件—软件契约解释指令集架构,并区分 ISA、微架构与制造工艺
  • 能从兼容性、核心与内存、I/O、功耗边界等字段审查服务器 CPU 资料
  • 能说明制程名称或单个峰值为何不能独立证明真实应用性能
  • 能把厂商事实、自己的推断和待实验验证的结论分栏记录

核心讲解

三层概念决定三类问题

指令集架构(ISA)规定指令、寄存器、异常和内存模型等软件可见行为,可把它理解为编译器、操作系统与处理器之间的合同。x86、Arm 和 RISC-V 的差异会影响二进制兼容、工具链与生态,但不能简单归结为某一种架构天生更快。相同 ISA 可以由不同流水线、缓存和执行单元实现,因此同为 x86 或同为 Arm 的处理器也可能有显著不同的吞吐、延迟和功耗表现。

微架构回答合同如何被实现,例如是否乱序执行、缓存多大、一次可发射多少指令;制造工艺回答晶体管如何被制造。制程节点名称在不同厂商、不同时间并非统一尺子,晶体管密度也只是设计约束之一。判断一颗芯片是否适合服务器工作负载,还要结合频率、核心数、内存通道、I/O、散热设计功耗、可靠性功能以及真实软件栈。

比较规格先校准对象和口径

比较鲲鹏 920 与 Intel Xeon 时,先确认资料是在描述某个 SKU、一个处理器系列,还是整机平台。核心数、频率、内存通道、PCIe 代际与插槽能力只有在同一层级、同一单位和相近用途下才适合并列;系列上限不能冒充任意型号的能力,整机可装多少块盘也不能算作 CPU 参数。所有数字旁都应保留产品名、文档标题、发布日期或核验日期。

峰值算力、基准测试和厂商宣称必须带测试条件。即使两个页面都写了“性能提升”,参照平台、编译参数、功耗限制和负载可能完全不同,不能直接相除得出胜负。学校式比较的目标不是选出万能冠军,而是建立证据链:事实来自哪里、哪些字段可比、哪些只是推断、还需要什么基准实验才能回答业务问题。

实践任务

以鲲鹏 920 服务器资料和 Intel Xeon 6 官方资料为证据,制作一张注明产品范围、口径和不可比项的参数对照表。

  • 分别打开鲲鹏 920 所在的 TaiShan 服务器数据表、Intel Xeon 6 产品简报和 Arm/RISC-V 架构资料,记录文档标题、URL 与核验日期。
  • 建立“产品范围、ISA、型号或系列、核心/频率、内存、PCIe、功耗口径、软件生态、来源”九列;只抄写页面明确给出的事实,缺项写“资料未给出”。
  • 给每一行标记“可直接比较”“需统一测试条件”或“不可直接比较”,并为后两类各写一句原因。
  • 选择一个场景(数据库、微服务或 AI 主机 CPU),写出三项选型约束和至少一项需要实测的指标,避免只按核心数下结论。

自测与答案

第 1 题

为什么同为 Arm ISA 的两颗服务器 CPU 仍可能有不同性能?

尚未检查本题。

查看答案与评价要点

参考答案:ISA 只规定软件可见行为;具体流水线、缓存、执行资源、内存与 I/O、频率和功耗边界由微架构与平台实现决定,因此需要在统一工作负载和条件下测量。

评价要点:区分 ISA 合同与微架构实现;至少指出缓存、执行资源、内存/I/O、频率或功耗中的两个变量;提出统一条件的实测需求

第 2 题

看到 A 芯片采用较新的制程名称,能否断言它在数据库负载上一定快于 B 芯片?请给出判定依据。

尚未检查本题。

查看答案与评价要点

参考答案:不能。制程名称不是跨厂商统一性能标尺,数据库性能还取决于微架构、内存与 I/O、核心配置、软件和测试条件;应查具体 SKU 并进行同条件工作负载测试。

评价要点:明确回答不能直接断言;说明制程口径与应用性能之间缺少直接等价关系;给出具体规格核对和可复现实验两类证据

尚未完成自测。

今日完成标准

  • 提交包含至少九个字段的双来源参数表,每个数字都可回查到官方 URL 和产品范围
  • 正确标出至少三项不可直接比较的字段,并为目标工作负载写出一项可检验假设
  • 在结论中分别标注事实、推断和建议,没有用制程或核心数单指标宣布胜负

常见错误与纠正提示

  • 把 Arm 或 RISC-V 等 ISA 名称当成某一颗具体芯片,并由架构标签直接推断性能
  • 把不同厂商的制程名称、TDP、系列上限或营销基准当成同口径数字横向排名
  • 只保存二手截图,不保留可回查的官方页面、产品范围和核验日期

分层任务

基础任务

完成概念三分卡:为 ISA、微架构、制造工艺各写一个定义和一个例子,并找出对照表中的三个不可比字段。

标准任务

完成九列对照表和场景化结论,至少引用两家厂商资料与一份架构规范,并明确一项待实测结论。

挑战任务

为同一场景设计一份可复现实验草案,控制编译器、数据规模、并发、功耗模式和预热时间,说明结果不能外推到哪些场景。

关联知识点

延伸阅读

学习状态:未学习

Day 2

GPU与AI芯片

建议时长:60 分钟

本日 CO:CO1 CO8

本日概要

从工作负载而不是品牌名称理解 GPU、NPU 与 TPU。GPU 通过大量并行线程和分层存储提升规则数据并行任务的吞吐,CUDA 把内核、线程块、线程和内存层次暴露给开发者;NPU 是面向神经网络运算的通用类别名,不同厂商实现与软件栈并不等价;TPU 是 Google 面向机器学习矩阵计算设计的专用加速器。选型必须同时检查数值精度、内存容量与带宽、互连、算子覆盖、编译器/运行时、框架适配和实际模型表现。

听书与视频

本日听书

6 分钟 · MP3 · 双主持人讲解

B 站讲解

AI为什么非要用显卡?根源是数学里的矩阵运算/深度长视频GPU物理结构与工作原理科普

小李老师_Leonard · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能解释 GPU 的 SIMT 并行、线程分组和分层存储为何适合高数据并行任务
  • 能区分 GPU、NPU 与 TPU 的类别边界,避免把厂商产品名当成统一技术标准
  • 能从精度、内存、互连、算子和软件生态五类约束评估 AI 加速器
  • 能识别 TOPS、TFLOPS 等峰值指标在精度和测试条件不同时不可直接换算

核心讲解

并行吞吐来自任务结构与数据移动

GPU 把大量线程组织成可调度的组,让同一内核在许多数据元素上并行执行。CUDA 的线程、线程块和网格帮助程序表达这种并行;同一 warp 内出现数据相关分支时,不同路径往往需要分段执行,因此“线程很多”不等于利用率必然很高。矩阵乘、卷积等规则计算通常更容易形成高并行度,而强串行、频繁分支或规模过小的任务可能无法摊薄调度与数据传输开销。

AI 计算不只发生在算术单元。模型权重、激活和中间结果要在主机内存、设备内存、缓存与计算单元之间移动,容量不足会迫使切分或卸载,带宽不足会让计算单元等待。多卡训练还要通过互连交换梯度或激活。因此选型表至少应把计算精度、容量、带宽、互连拓扑和软件支持分开,而不是只比较一个峰值数字。

专用加速器必须连同软件栈一起评价

NPU 通常指针对神经网络算子优化的处理器类别,但没有一个跨厂商统一的 NPU 微架构或编程接口。昇腾平台以 CANN 连接上层框架与底层处理器,Google Cloud TPU 则依赖 TPU VM、编译器和支持的框架把图转换为设备程序。硬件峰值只有在算子可被编译、精度满足要求、数据供给及时且运行时稳定时才可能转化为有效吞吐。

比较 GPU、NPU、TPU 时要先固定任务:训练还是推理、批大小与序列长度、允许的数值精度、延迟目标、模型算子和部署环境。不同厂商对 TOPS 或 FLOPS 的计算可能使用不同数据类型、稀疏条件或峰值假设,不能把宣传页的数字直接当作端到端速度。可信结论应引用同一模型、同一精度、同一数据与软件版本下的实测记录。

实践任务

依据 NVIDIA CUDA、Google Cloud TPU 与昇腾 CANN 官方文档,为一个训练或推理场景画出“模型—框架—编译/运行时—加速器—内存/互连”适配链。

  • 选定“图像分类批量推理”或“小模型微调”之一,写清模型、输入形状、批大小、精度、延迟/吞吐目标和可用内存。
  • 从三份官方文档提取线程/矩阵计算方式、框架入口、编译或运行时、内存/互连关注点,未披露的数据明确留空。
  • 画出从 Python 框架调用到编译/运行时、设备内存、计算单元和结果返回的链路,并在每条边标出可能的等待或不兼容风险。
  • 写一段选型说明:列出两个已有证据支持的事实、一个仍需基准实验验证的假设,以及不可直接比较的峰值指标。

自测与答案

第 1 题

为什么高峰值 FLOPS 的设备仍可能在某个模型上利用率很低?

尚未检查本题。

查看答案与评价要点

参考答案:模型可能受内存容量或带宽、主机到设备传输、算子不支持、分支发散、规模过小或互连通信限制,峰值算术能力无法自动转化为端到端吞吐。

评价要点:指出峰值是特定条件下的算术上限;至少说明数据移动和软件/算子中的各一个瓶颈;提出用实际模型与统一设置测量

第 2 题

把一个 NPU 的 INT8 TOPS 与另一个 GPU 的 BF16 TFLOPS 直接比较,主要错在哪里?

尚未检查本题。

查看答案与评价要点

参考答案:两者运算类型、精度、计数方式和适用任务不同;还未控制稀疏性、软件、模型和功耗等条件,因此数字不是同一量纲下的端到端性能证据。

评价要点:识别 INT8 与 BF16 精度和运算定义不同;说明峰值口径不等于模型结果;列出至少两个需要统一的实验条件

尚未完成自测。

今日完成标准

  • 提交完整的五层适配链,能追踪一次模型调用从框架到硬件再返回的路径
  • 选型说明覆盖精度、内存/带宽、互连、算子和软件生态,且明确至少一个待验证假设
  • 没有把不同精度或不同厂商口径的峰值数字作直接排名

常见错误与纠正提示

  • 把 GPU 核心数、NPU 核数或 TPU 矩阵单元数量视为跨架构等价单位
  • 忽略精度、稀疏条件、批大小和软件版本,直接用 TOPS/TFLOPS 宣布端到端性能
  • 只画硬件方框,不标出框架、编译器、运行时、内存与互连造成的约束

分层任务

基础任务

用一页表解释 CPU 串行控制、GPU 数据并行和专用矩阵加速的典型优势与限制,不填写未经来源支持的峰值参数。

标准任务

完成五层适配链和场景化选型说明,至少识别一个算子支持风险、一个内存风险和一个指标口径风险。

挑战任务

设计同模型跨两类加速器的基准协议,固定预热、精度、批大小、功耗口径和软件版本,并定义延迟分位数、吞吐与准确率三类结果。

关联知识点

延伸阅读

学习状态:未学习

Day 3

服务器硬件

建议时长:60 分钟

本日 CO:CO1 CO8

本日概要

把服务器看成可被管理、供电和散热的系统,而不是放大版个人电脑。主板把 CPU、内存、PCIe 扩展、存储控制器、网卡和加速器连接为数据路径;BMC 提供独立于主操作系统的带外管理,Redfish 等标准让资产、传感器与操作可被程序访问;机架层还要考虑双路供电、风道、网络冗余、重量与维护空间。架构图应同时表达数据流、控制/管理流、电力/散热约束和故障域。

听书与视频

本日听书

6 分钟 · MP3 · 双主持人讲解

B 站讲解

服务器硬件知识:从入门到放弃

IT姬密局 · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能识别 CPU、内存、PCIe、加速器、存储、NIC 与 BMC 的职责和连接关系
  • 能区分业务数据路径、带外管理路径以及电力与散热路径
  • 能用带宽、容量、槽位、NUMA 与故障域检查服务器架构图
  • 能说明冗余部件只有在路径独立且故障切换可验证时才提升可用性

核心讲解

从部件清单转向端到端路径

服务器中的 CPU 通过内存控制器访问内存,并经 PCIe 根复合体连接网卡、NVMe 设备或 AI 加速器。双路系统常形成 NUMA:每颗 CPU 更接近一部分内存和 I/O,跨插槽访问可能增加延迟并占用互连。画图时不能只列“CPU、GPU、SSD”,还要标明设备挂在哪个 CPU、链路宽度或代际、数据从 NIC 到内存再到加速器的方向。

容量约束也存在于物理空间。机箱只有有限插槽、硬盘位和风扇能力,高功耗加速卡会改变供电与风道设计;电源额定值不是业务可随意占满的预算。服务器数据表中的“最多”通常依赖特定配置,学习者应记录前提,并把峰值插槽数量、实际装配和可维护余量分开。

BMC、机架与故障域

BMC 是独立管理控制器,可在主操作系统不可用时读取传感器、查看硬件清单、控制电源或更新固件。DMTF Redfish 用基于 Web 的接口和数据模型描述这类资源。带外管理网应与业务网分开规划并实施访问控制,因为它拥有高权限;把 BMC 画在业务数据流中或暴露到公共网络,都会模糊安全边界。

进入机架后,服务器依赖机架交换机、配电单元、上游电源和冷却。两块电源只有分别接入独立供电路径才可能抵御单路故障,两张网卡若都接同一交换机也仍共享故障点。可靠架构图应标出节点、链路和故障域,并写明“某部件失效后,业务是否继续、如何发现、如何恢复”。

实践任务

为一台带 AI 加速卡的 2U 双路服务器画内部架构图,并扩展到包含供电、交换机与管理网络的机架视图。

  • 在画布中心放置两颗 CPU,各自连接本地内存;把 NIC、NVMe 与 AI 加速卡挂到明确的 PCIe/CPU 路径,并用箭头画出一次推理请求的数据流。
  • 加入 BMC、管理交换机和管理员终端,用不同颜色画带外管理流;标注认证、最小权限和不经公网暴露的边界。
  • 扩展到机架:加入 A/B 电源、PDU、业务交换机和散热风向,圈出同一交换机、同一 PDU、同一机箱等共享故障域。
  • 从官方数据表选取三个有来源的配置事实,在图注中写清型号/系列和核验日期;再列出两个需向供应商确认的配置前提。

自测与答案

第 1 题

BMC 与主机操作系统是什么关系?为什么管理网络要单独保护?

尚未检查本题。

查看答案与评价要点

参考答案:BMC 是可独立于主机操作系统运行的管理控制器,可读取硬件状态并执行高权限操作;即使主机宕机它仍可能可达,因此需要隔离、认证、最小权限和审计。

评价要点:说明 BMC 的独立带外属性;指出传感器、资产、电源或固件中的至少两个管理能力;给出隔离、认证、最小权限或审计中的至少两项保护

第 2 题

一台双路服务器的加速卡挂在 CPU0 的 PCIe 根端口,而数据位于 CPU1 本地内存,图上应提示什么风险?

尚未检查本题。

查看答案与评价要点

参考答案:数据可能跨插槽互连传输,增加延迟并占用互连带宽;应核对 NUMA 绑定、设备亲和性和内存分配,并用实测验证。

评价要点:识别跨 NUMA 路径;说明延迟或带宽影响;提出绑定/分配检查和测量

尚未完成自测。

今日完成标准

  • 架构图完整呈现计算、内存、PCIe、加速器、存储、网络、BMC、供电和散热要素
  • 用不同线型区分三类路径,并对至少三个共享故障域写出失效影响
  • 至少三个配置事实附官方来源,未确认的机型假设被明确标为待核验

常见错误与纠正提示

  • 把所有内存与 PCIe 设备画成对所有 CPU 等距离,忽略 NUMA 与根端口归属
  • 把 BMC 当成业务操作系统中的普通程序,或把高权限管理接口直接连到公网
  • 画了双电源或双网卡就宣称无单点,却没有检查上游 PDU、交换机和链路是否独立

分层任务

基础任务

完成单机部件图,并能口述一次网络请求经过 NIC、内存、CPU/加速器和存储的路径。

标准任务

完成单机与机架双层图,使用三种线型区分数据、管理和供电/散热,并标出至少三个故障域。

挑战任务

为一个双加速卡 NUMA 系统提出设备亲和性与冗余验证清单,解释跨插槽访问和共享上游设备可能造成的影响。

关联知识点

延伸阅读

学习状态:未学习

Day 4

存储基础

建议时长:60 分钟

本日 CO:CO1 CO8

本日概要

用“介质—接口/协议—阵列—工作负载指标”四层理解存储。HDD 以旋转介质和机械寻道保存数据,SSD 以闪存和控制器工作;SATA、SAS、PCIe 与 NVMe 描述的是不同层次的连接或协议,NVMe 不是闪存颗粒本身。IOPS、吞吐、延迟必须带块大小、读写比例、队列深度、并发和持续时间;RAID 通过条带、镜像或校验组合设备,主要服务可用性、容量和性能目标,但不能替代独立备份。

听书与视频

本日听书

6 分钟 · MP3 · 双主持人讲解

B 站讲解

存储基础知识

信创-国产之道 · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能区分 HDD/SSD 介质、SATA/SAS/PCIe 连接和 NVMe 命令/传输协议的层次
  • 能用块大小、读写比例、队列深度、IOPS、吞吐和延迟描述存储负载
  • 能解释常见 RAID 思路在容量、性能、可用性和重建风险之间的权衡
  • 能设计带安全边界、原始记录和限制说明的非破坏性存储对比

核心讲解

先把介质、总线和协议拆开

HDD 的机械寻道与旋转等待使随机访问特征不同于顺序访问;SSD 没有机械寻道,但仍受闪存擦写、控制器、缓存、垃圾回收和耐久性约束。SATA 与 SAS 是主机连接存储设备的接口/协议族,PCIe 是高速互连,NVMe 定义主机软件如何通过 PCIe 等传输与非易失存储通信。把“NVMe”与“SSD”当同义词,会遗漏 SATA SSD 和不同形态的 NVMe 设备。

一条 I/O 路径还包含文件系统、操作系统页缓存、驱动、控制器和设备缓存。应用观察到的延迟不一定等于介质延迟,复制一个文件也不能代表随机数据库访问。分析时应先画路径,再说明测量点是在应用、系统调用、块设备还是硬件层;不同层的数字不能无条件相减或混用。

指标与 RAID 都必须绑定故障假设

IOPS 是单位时间完成的 I/O 数,吞吐是单位时间传输的数据量,延迟描述单次操作耗时;三者受块大小、读写混合、队列深度、并发、缓存命中和测试时长共同影响。小块随机 I/O 与大块顺序读的结果回答不同问题。只写“某盘 IOPS 更高”而没有测试条件,无法支持模型加载、日志落盘或数据库选型。

RAID 0 用条带提升并行和容量但不提供冗余;镜像与校验方案在可用容量、写入代价、故障容忍和重建压力间权衡。RAID 不能防误删、勒索软件、控制器逻辑错误或站点灾难,因此备份需要独立副本、恢复点和恢复演练。评价阵列必须明确允许同时坏几块盘、重建期间负载以及备份恢复目标。

实践任务

为日志写入、模型加载和归档三个工作负载建立存储对比矩阵,并设计不破坏真实数据的基准计划。

  • 为日志写入、模型权重加载和冷数据归档分别写出访问模式、块大小趋势、读写比例、延迟或吞吐优先级和数据耐久要求。
  • 建立 HDD、SATA SSD、NVMe SSD 对比矩阵,区分介质、主机接口/协议和外形;不确定的性能数字不填,用官方规范说明层次关系。
  • 为其中一个场景设计基准:固定数据集、块大小、读写比、队列深度、预热、持续时间和缓存策略,输出平均值与至少一个尾延迟分位数。
  • 写出安全边界:只在临时测试文件或专用测试盘上运行、先验证目标路径、不对生产盘做写入压测,并记录设备型号、固件和工具版本。

自测与答案

第 1 题

为什么“NVMe 比 SSD 快”在概念上不严谨?

尚未检查本题。

查看答案与评价要点

参考答案:SSD 描述以固态介质构成的设备,NVMe 描述主机与非易失存储通信的协议体系;许多 NVMe 设备是 SSD,但也存在 SATA SSD,二者不是同一分类层次。

评价要点:指出 SSD 是设备/介质类别而 NVMe 是协议;给出 SATA SSD 或 NVMe SSD 的反例;说明性能还要绑定设备与工作负载

第 2 题

RAID 1 已有镜像,为什么仍需备份?

尚未检查本题。

查看答案与评价要点

参考答案:镜像主要应对设备故障,误删、错误写入、恶意加密或控制器/站点故障可能同步影响镜像;独立备份和恢复演练才能提供不同恢复点与故障域。

评价要点:区分可用性冗余与历史恢复副本;至少列出两种会同时影响镜像的数据风险;指出独立故障域和恢复验证

尚未完成自测。

今日完成标准

  • 对比矩阵正确区分介质、接口/总线、协议和阵列四个层次
  • 基准计划明确至少七项测试条件并包含生产数据保护边界
  • 能针对一个场景解释 IOPS、吞吐、延迟、RAID 与备份各自回答的问题

常见错误与纠正提示

  • 把 NVMe 当作闪存介质名称,或把 PCIe、SATA、SAS 与 HDD/SSD 放在同一层直接分类
  • 比较 IOPS 或延迟时省略块大小、读写比、队列深度、缓存和持续时间
  • 把 RAID 冗余当作备份,忽略误删、逻辑损坏和站点级故障

分层任务

基础任务

完成四层存储概念卡,并为顺序模型加载和随机日志索引各选择一个主要指标。

标准任务

完成三场景对比矩阵、一个可复现基准计划和 RAID/备份边界说明。

挑战任务

为两种 RAID 方案建立故障与重建分析,讨论降级期间尾延迟、可用容量和恢复目标,不执行破坏性操作。

关联知识点

延伸阅读

学习状态:未学习

Day 5

网络基础(一)

建议时长:60 分钟

本日 CO:CO1 CO8

本日概要

沿一次真实连接理解分层网络,而不是背诵七层名称。应用生成数据,传输层用 TCP 提供面向连接的可靠字节流,IP 负责跨网络寻址与转发,以太网在本地链路用帧和 MAC 地址传递数据,交换机依据转发表在端口间转发。封装让每层只处理自己的头部和职责。Wireshark 可把链路上的帧解析成各层字段;抓取 TCP 握手时应识别 SYN、SYN-ACK、ACK 的方向、序列/确认关系和连接四元组,并只在本人设备与获授权网络上采集。

听书与视频

本日听书

5 分钟 · MP3 · 双主持人讲解

B 站讲解

花50分钟一口气入门网络基础,Linux运维入门必须要看!讲得太好了!

马哥教育实战 · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能把应用数据、TCP 段、IP 包和以太网帧按封装关系对应起来
  • 能解释交换机、路由器与端系统分别依据哪些信息处理报文
  • 能在 Wireshark 中用连接四元组和标志位识别 TCP 三次握手
  • 能遵守授权、最小采集、脱敏和删除原始敏感数据的抓包边界

核心讲解

分层是职责边界,不是七个孤立盒子

发送端应用把字节交给传输层;TCP 通过端口区分通信端点,并使用序列号、确认和重传机制提供可靠、有序的字节流。IP 层加入源/目的地址,允许路由器逐跳选择下一跳;到达某段本地网络时,以太网帧使用源/目的 MAC 地址传给下一跳。接收端按相反方向解封装,最终把字节交给对应应用。

交换机通常在二层学习源 MAC 与端口的关系,再按目的 MAC 转发;路由器查看三层目的网络并决定下一跳。MAC 地址只解决当前链路交付,IP 地址表达端到端寻址,TCP 端口标识进程通信端点。把三者混成“设备地址”会导致排障时找错层:同一 IP 会经过多个二层帧,每一跳的 MAC 对可能改变。

从握手证据读取连接建立

TCP 建连常以客户端 SYN、服务端 SYN+ACK、客户端 ACK 三个报文体现。分析重点不是背口令,而是确认方向一致:同一源/目的 IP 与端口构成连接四元组,SYN 建议初始序列空间,确认号表示对对方序列的确认。抓包中还可能出现重传、IPv6、代理或本机回环,因此要先选定一条 TCP stream,再解释具体字段。

抓包可能包含 Cookie、令牌、域名、内部地址或他人通信内容。实验只捕获自己发起且已获授权的最少流量,优先使用显示过滤器缩小范围;分享时裁剪与脱敏,原始 pcapng 按课程要求保存在本地并及时删除。公共网络或不属于自己的设备不是练习场,管理员权限也不代表获得了数据处理授权。

实践任务

在授权的本机流量中用 Wireshark 捕获一次 TCP 建连,保存脱敏截图或 pcapng,并用分层表解释三个握手报文。

  • 确认仅采集本人设备上的授权流量,关闭含敏感会话的应用;在 Wireshark 选择正确接口,并以 `tcp port 443` 作为捕获过滤器缩小范围。
  • 开始捕获后由本人执行一次 `curl https://example.com/` 或在浏览器访问同一测试站点,立即停止捕获;记录命令/动作、时间和接口。
  • 使用显示过滤器 `tcp.flags.syn == 1` 找到候选报文,再通过 Follow TCP Stream 或四元组定位同一连接的 SYN、SYN-ACK 与 ACK。
  • 制作三行分析表,记录方向、标志位、源/目的端口、序列/确认关系和所属层;截图前遮盖与学习目标无关的地址或载荷,按要求删除原始敏感捕获。

自测与答案

第 1 题

为什么同一个 IP 数据包跨越路由器后,以太网源/目的 MAC 地址可能改变?

尚未检查本题。

查看答案与评价要点

参考答案:IP 负责端到端网络寻址,而以太网帧只负责当前链路到下一跳的交付;路由器解开入站帧并为出站链路重新封装,所以 MAC 对随链路变化。

评价要点:区分三层端到端地址与二层逐链路地址;说明路由器重新封装;指出 IP 目的地址通常仍用于后续路由

第 2 题

仅看到三个带 SYN/ACK 的相邻报文,为什么还不能立即断言它们是同一次三次握手?

尚未检查本题。

查看答案与评价要点

参考答案:相邻报文可能属于不同连接或重传;应核对源/目的 IP 与端口、方向、标志位以及序列/确认关系,确认属于同一 TCP stream。

评价要点:指出可能混入不同连接或重传;要求核对四元组与方向;要求核对序列/确认或同一 stream

尚未完成自测。

今日完成标准

  • 提交三报文分析表,三个报文属于同一四元组且方向、标志与序列确认关系解释正确
  • 能用一张封装图说明应用/TCP/IP/以太网关系及交换机与路由器的处理边界
  • 证据注明授权范围、采集步骤与脱敏处理,不包含无关敏感载荷

常见错误与纠正提示

  • 把 MAC、IP 和 TCP 端口都称为主机地址,无法说明它们的作用范围
  • 只按相邻三行猜握手,不核对四元组、方向、SYN/ACK 标志和序列确认关系
  • 在公共或未授权网络长时间全量抓包,并直接提交包含令牌、域名或内部地址的原始文件

分层任务

基础任务

使用教师提供的脱敏抓包截图完成三次握手字段标注,并把四层封装画成嵌套图。

标准任务

在本机授权流量中完成最小抓取、三报文分析表和脱敏证据,解释交换与路由的分工。

挑战任务

在同一连接中再定位一次重传或连接关闭过程,说明它与建连不同;若没有自然出现,不人为制造网络攻击或干扰。

关联知识点

延伸阅读

学习状态:未学习

Day 6

网络基础(二)

建议时长:60 分钟

本日 CO:CO1 CO8

本日概要

把从域名到后端服务的路径串起来:VLAN 在二层划分广播域,路由在三层连接不同网络,DNS 把名字解析为资源记录并允许缓存,CDN 把可缓存内容或代理节点放到更接近用户的位置,负载均衡器通过监听器、转发规则、后端组与健康检查把请求分配给可用实例。华为云 ELB 官方文档区分四层和七层处理;学习时重点是控制面配置、数据面转发与健康状态的关系,而不是把 DNS、CDN 和 ELB 当成同一个“加速器”。

听书与视频

本日听书

6 分钟 · MP3 · 双主持人讲解

B 站讲解

零基础自学网工:数据通信网络基础(交换机、路由器、防火墙等)网工入门丨华为认证丨HCIA丨HCIP丨HCIE丨数据通信

优小希工程师 · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能区分 VLAN、路由、DNS、CDN 与负载均衡各自处理的对象和作用范围
  • 能解释监听器、转发策略、后端服务器组和健康检查构成的 ELB 数据路径
  • 能比较四层与七层负载均衡所依据的信息及其典型限制
  • 能通过故障推演识别 DNS 缓存、单可用区、健康检查误判和会话状态风险

核心讲解

名字、网络与二层隔离解决不同问题

VLAN 给同一物理交换基础设施划分逻辑二层广播域,不同 VLAN 之间通常需要三层设备转发。路由器根据目的网络和路由表选择下一跳,它不会因为两个名字相似就自动知道应用关系。DNS 是分布式命名系统,解析器查询名称对应的资源记录并按 TTL 等规则缓存;DNS 返回地址不等于建立了 TCP 连接,也不检查某个应用请求是否成功。

以 Amazon CloudFront 官方工作流程为例,DNS 把请求引向可服务该请求的边缘节点;边缘先检查缓存,命中时直接返回,未命中时再向源站请求并缓存返回对象。这个实例说明边缘缓存可以减少回源请求,但不能据此假定所有 CDN 的选路、缓存键或回源配置完全相同。排障仍要沿时间顺序记录:客户端得到哪个解析结果、连接到哪个入口、是否命中边缘、请求如何到达源站或后端。

ELB 是一条带健康判断的转发路径

负载均衡器先由监听器接收指定协议和端口的流量,再依据算法或七层规则选择后端服务器组中的实例。四层转发主要依据 IP、端口与传输协议信息;七层转发可以理解 HTTP/HTTPS 请求并按主机名、路径或头部等内容做更细粒度决策。选择哪一层要看协议、路由需求、终止加密的位置、观测能力与性能目标。

健康检查决定某后端是否继续接收新流量,但“端口可连”不等于业务完整可用。检查过浅可能把数据库已断开的应用判为健康,检查过严又可能在短暂抖动时大规模摘除实例。双可用区也需要后端真实跨区部署,并验证故障后容量、会话和数据层是否承受转移;一个 ELB 图标不能自动消除所有单点。

实践任务

基于华为云 ELB 官方工作原理,为双可用区 Web 服务画请求路径和单后端故障推演,无需开通或付费创建云资源。

  • 设定场景:用户访问 `app.example`,入口含 DNS、可选 CDN、华为云 ELB、两个可用区各两台后端;列出协议、端口和静态/动态内容假设。
  • 画正常路径,分别标出 DNS 回答、客户端连接、监听器、转发规则、后端组、健康检查和响应返回,并用图例区分控制面配置与数据面流量。
  • 推演一台后端进程停止:写出健康检查在什么条件下判失败、该实例何时停止接收新请求、现有连接或会话可能怎样变化。
  • 再推演一个可用区不可达,检查 DNS/CDN 缓存、剩余容量、会话状态和数据依赖;列出三项需要监控的信号和一个演练限制。

自测与答案

第 1 题

DNS 已把域名解析到负载均衡地址,为什么仍不能证明应用健康?

尚未检查本题。

查看答案与评价要点

参考答案:DNS 主要提供名称到资源记录的解析且结果可能被缓存;它不验证 ELB 监听器、后端、依赖或业务响应。还需检查连接、负载均衡健康状态和端到端请求。

评价要点:说明 DNS 的命名/缓存职责;指出负载均衡与后端健康是独立状态;提出端到端验证

第 2 题

四层与七层负载均衡的主要判别信息有什么不同?

尚未检查本题。

查看答案与评价要点

参考答案:四层主要依据 IP、端口和传输协议转发;七层理解 HTTP/HTTPS 等应用内容,可按主机名、路径或头部等规则处理,但也引入应用协议与 TLS 终止等设计选择。

评价要点:正确列出四层判别信息;正确列出七层内容路由能力;指出协议、TLS、观测或性能中的一个权衡

尚未完成自测。

今日完成标准

  • 请求路径包含 VLAN/路由边界、DNS、可选 CDN、ELB 监听器、后端组、健康检查和跨区后端
  • 两次故障推演都写明触发条件、状态变化、剩余风险与可观测证据
  • 能清楚解释四层/七层差异,并声明本练习未创建付费云资源或提供实际资源清理记录

常见错误与纠正提示

  • 把 VLAN 当成路由协议,或认为不同 VLAN 不经三层转发也能自然互通
  • 把 DNS、CDN 与 ELB 合成一个盒子,忽略各自缓存、健康状态和控制面
  • 认为配置了两个后端或多个可用区就一定高可用,不验证健康检查、容量、会话和数据层

分层任务

基础任务

完成五个概念的输入—处理—输出表,并在教师提供的 ELB 图中标出监听器、后端组和健康检查。

标准任务

完成正常路径及两个故障推演,区分控制面/数据面并提出三项可观测信号。

挑战任务

比较四层与七层方案在 TLS 终止、客户端地址、会话黏性、路径路由和故障定位上的权衡,写出验证实验而非绝对结论。

关联知识点

延伸阅读

学习状态:未学习

Day 7

周末复盘

建议时长:75 分钟

本日 CO:CO1 CO8

本日概要

把本周碎片知识收束为可检验的基础设施链路:用户名称经 DNS 得到入口,网络把请求送入 CDN 或负载均衡,交换与路由把流量交给服务器 NIC,CPU/内存协调应用与数据,加速器执行适合的并行计算,存储保存模型和结果,BMC、供电、散热与监控维持系统可管理性。复盘不只是重画名词,而要为每个节点写输入、输出、关键约束、故障表现和证据来源,并区分业务数据流、控制/管理流和资源保障路径。

听书与视频

本日听书

6 分钟 · MP3 · 双主持人讲解

B 站讲解

学习分享:浅析数据中心服务器液冷技术

It_server技术分享 · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能按请求时间线解释芯片、服务器、存储、网络到数据中心服务的完整链路
  • 能在一张图中区分业务数据流、控制/管理流以及供电散热保障路径
  • 能用故障推演检查组件关系、冗余边界和观测证据,而非只统计方框数量
  • 能按 CO1/CO8 和四级量规自评架构图,形成可复核来源清单

核心讲解

用一次请求检查知识链是否闭合

从用户提交一个推理请求开始:DNS 返回服务入口,客户端经网络建立连接,CDN 或 ELB 按配置把请求送到健康后端;NIC 接收帧后,操作系统和应用在 CPU/内存中解析请求,模型数据可能从存储进入内存与加速器,结果再沿相反方向返回。每条箭头都应有动词,例如“解析”“转发”“DMA 传输”“读取权重”,避免用没有语义的连线。

同一架构还存在控制与保障路径。BMC 和管理网负责带外状态与操作,监控收集延迟、错误和资源利用率,供电与散热决定部件能否持续运行。它们可能不直接承载用户数据,却会决定故障能否被发现和恢复。把三类路径使用不同颜色或线型表达,能避免误把管理接口暴露到业务面。

用证据和故障反向审图

架构图中的事实应能回到规范或厂商文档,例如接口代际、服务器槽位或服务工作方式;“适合我们的负载”通常是推断,需要需求和实验支持。来源清单至少保存标题、HTTPS URL、核验日期和它支持的图中声明。若页面描述的是系列上限,图注不能把它写成已选 SKU 的确定配置。

故障推演比“高可用”标签更有检验力。任选后端进程停止与单路电源/交换机失效,沿箭头追踪检测、隔离、流量转移和恢复;若路径仍经过同一 PDU、同一交换机或同一数据副本,就要如实标为共享故障域。最终自评依据是关系是否正确、证据是否对应,而不是图是否华丽。

实践任务

完成“从芯片到数据中心架构图”作业草稿,用一条推理请求和两个故障场景验证关系,附来源清单与自评。

  • 确定边界与场景:一项在线 AI 推理服务,从用户域名开始,到结果返回结束;列出必须出现的计算、加速、内存、存储、网络、管理与供电散热要素。
  • 画正常请求的编号路径,使用三种线型分别表示业务数据、控制/管理和供电/散热;为每个节点补写输入、输出和一个关键约束。
  • 推演“一个后端进程停止”和“单路电源或机架交换机失效”,标注发现信号、受影响路径、冗余是否生效以及仍存在的共享故障点。
  • 建立来源清单,把每条来源映射到具体图注;使用 Week 1 专用量规从完整性、概念准确性、关系表达和证据四个维度自评并修订。

自测与答案

第 1 题

在“用户请求—ELB—服务器—AI 加速器”链路中,为什么还必须画内存、存储和 NIC?

尚未检查本题。

查看答案与评价要点

参考答案:请求与模型数据需经 NIC、主机内存和存储进入 CPU/加速器,数据移动、容量和 I/O 可能成为瓶颈;省略它们会隐藏真实接口与故障路径。

评价要点:说明网络数据通过 NIC 进入主机;说明模型/数据涉及存储与内存;指出数据移动、容量或 I/O 瓶颈

第 2 题

一张图标了“双电源”,还需要什么证据才能支持“可抵御单路供电故障”?

尚未检查本题。

查看答案与评价要点

参考答案:需证明两块电源连接独立的 A/B PDU 或供电路径、容量足以在单路下承载负载,并通过受控切换/故障演练或设备记录验证。

评价要点:要求上游供电路径独立;检查单路容量;提出可核验的切换测试或运行记录

尚未完成自测。

今日完成标准

  • 架构图可按编号完整口述一次请求,三类路径和至少两个共享故障域表达清楚
  • 两个故障场景都包含检测信号、影响、转移/恢复与残余风险,不用“自动容灾”代替分析
  • 来源清单含至少四条官方资料并逐条映射图中声明,四维自评均有具体证据

常见错误与纠正提示

  • 把架构图画成互不相连的产品 Logo 集合,没有请求顺序、数据方向和接口语义
  • 只画业务流,不画 BMC 管理、监控、供电散热或共享故障域
  • 在图中写“高性能”“高可用”却没有需求、来源、指标或故障推演作为证据

分层任务

基础任务

使用给定组件卡完成编号请求路径,并为每个节点写一句职责;来源可使用本周已核验资料。

标准任务

独立提交三类路径完整、含两个故障推演和来源映射的架构图,并完成四维量规自评。

挑战任务

为架构加入 NUMA/PCIe 归属、跨可用区容量和尾延迟观测,提出一项可复现实验验证最可能的瓶颈。

关联知识点

延伸阅读

学习状态:未学习