- 01历史数据记录已经发生的案例
- 02学习规律寻找可重复的统计关系
- 03建立模型把规律保存为判断方法
- 04预测或分析处理从未见过的新数据
机器学习,是从历史数据中寻找可重复的统计规律,建立模型,再对新数据进行分类、预测或分析。
先建立正确直觉
机器学习,与传统程序有什么不同?
两种方法都重要。区别不在于谁更高级,而在于规则由人明确写出,还是由数据帮助我们找到。
人先写清规则
如果
考试分数 ≥ 60那么判断为及格条件明确、边界稳定时,传统程序更直接、可控,也更容易验证。
让历史案例呈现规律
学习时长作业完成出勤情况考试结果
模型从过去学生的数据中学习,再预测一位新学生的及格概率。
判断方法
规则可以完整、清楚地写出来,优先考虑传统程序;规则很难穷举,但有足够相关的历史数据,可以考虑机器学习。
共同特点
五个特点,理解机器学习如何工作
点击卡片查看具体例子与使用提醒。
典型应用
先看问题,再判断它属于哪种场景
五类任务的区别,来自最终希望模型回答的问题。
分类场景
它属于哪一类?
依据带有正确类别的历史样本,为新对象判断类别。
登录次数、使用时长、投诉次数、是否续费
高流失风险 · 78%
常见例子客户是否会流失邮件是否为垃圾邮件贷款风险高或低评论情感正向或负向产品是否存在质量问题
快速辨别
这五个问题,分别适合哪种场景?
每题选择后立即查看判断依据。答错没关系,目标是建立问题分类的直觉。
判断一位客户下月是否会续费
预测某商品下个月能卖出多少件
不知道客户类型,想让系统自动分群
找出用户最可能感兴趣的商品
从设备运行记录中发现异常数据
决策工具
你的问题,适合使用机器学习吗?
依次回答四个问题,得到一份基础判断。它不是项目立项结论,但能帮助你发现关键缺口。
问题是否有明确、可衡量的目标?
避免误区
五个常见说法,哪里不准确?
机器学习的价值来自正确使用,不来自对技术的过度想象。
误区 · 机器学习就是所有人工智能
机器学习是一类从数据中建立模型的方法;本课只讨论机器学习。
误区 · 数据越多,模型一定越好
错误、偏差或不相关的数据,也会让模型学到错误规律。
误区 · 准确率 95%,模型就一定有用
还要分析错误发生在哪里、错误成本以及是否真正改善业务。
误区 · 模型部署后会自动越来越聪明
数据更新、标注、评估和重新训练,都需要主动设计与执行。
误区 · 复杂问题都应该使用机器学习
目标、数据、规律、容错与成本都合适才值得使用;规则明确时传统程序更直接。
COURSE 01 · SUMMARY
记住这 5 句话,
你就理解了机器学习的基本逻辑
- 机器学习从历史数据中寻找可重复的统计规律。
- 规则难以完整写出、但有历史案例的问题,更值得考虑机器学习。
- 数据质量和代表性会直接影响模型效果。
- 模型输出类别、概率或预测值,因此可能出错。
- 分类、回归、聚类、推荐与异常检测,解决的是不同问题。
机器学习不是让机器像人一样思考,而是利用历史数据,让分类、预测和分析更有依据。