青少年创新数字出版平台
Canonical Concept

机器学习的一般流程

信息技术 · 高中 · 信息系统与社会 · 这个领域的第 17 / 20 个

结构草稿ekos:it:senior:system:ml-flow
在 Explore 里看它在先修图上的位置 →

依次完成数据收集与清洗、特征提取、划分训练集与测试集、训练模型、评估效果以及在新数据上应用。

这一节包含的知识点

比「节」更细的一层:具体到能对上一道题的步骤。

  • 数据准备与划分先收集并清洗数据、提取合适的特征,再把样本划分为训练集和测试集,用测试集衡量模型在未见数据上的表现。
  • 模型训练与评估用训练数据调整模型参数使其拟合数据中的规律,再用准确率、精确率、召回率等指标在测试集上评价模型优劣。
  • 机器学习应用的局限模型只能反映训练数据中出现的统计规律,数据有偏或应用场景变化时容易失效,而且往往难以解释作出判断的理由。
  • 特征与标签的作用特征是模型看得到的输入,标签是希望模型学会预测的答案。
  • 过拟合与欠拟合模型太复杂会记住训练数据的噪声,太简单又学不到规律,都需要调整。

先修:学它之前要先会

完整前置链:一路要先会

不只是直接先修 —— 把先修的先修也追到底,顺序就是该学的顺序(含跨学科)。

  1. 1信息系统的组成→
  2. 2数据库与 SQL→
  3. 3人工智能与机器学习初步

后继:学会它之后可以往哪走

坐标系里还没有概念把这条当先修。

这条概念还没有写学习目标与更细的正文(上面那句一句话解释已经是坐标系里有的全部)。 再往下长内容有两条路:接真实教材 / 出版物(见 Publishing),或接真实 AI(受 STOP 6 阻塞)。
Learn

学习「机器学习的一般流程」

这个知识点还没有内容(还没有教材或出版物接进来)。现在能做的:看清它在坐标系里的位置 —— 先修是什么、学完之后通向哪里,然后把「我了解了」记下来。

这一节先看这一条知识点:数据准备与划分(它的先修还没了解:监督、无监督与强化学习、数据采集与清洗)

自述不等于掌握:它只是「我知道这一条讲什么」,不会计入学习单元完成数。学习记录存在这台设备上。

内容覆盖

还没有任何内容覆盖这条概念。要让它长出来,需要导入并发布一份讲到它的材料 —— Publishing 会在正文里找候选(带原句作证据),由人确认后挂到这条上。

学习链 · 目标 / 测评 / 任务
目标 0 · 测评 0 · 任务 0

还没有任何学习目标、测评或任务标注到这条知识点上。学习链只列**真的标注过**的条目 —— 没有就是没有,不按模板补一个出来。

来源与边界

来源 ekos:draft-v0 · 基于公开通识整理的结构草稿;不含课标原文;待学科专家审阅