在点之间画线,回归
假设学的时间越长,分数往往越高。每个人不一样,所以点是散开的。可只要把整体的走势画成一条线,新学了五个小时的人的分数也能从那条线上估出来。在散开的点之间画出最贴合的直线,这个办法就是回归。
从散开的点开始
前面我们看过值散开的程度,
还一起看了平均。
这次看的不是一个值,
而是成对的两个值。
就像学的时间和得的分数。
把时间放横轴,分数放纵轴,
一个人就成了一个点。
因为每个人不一样,
点不会整齐地落在一条线上,
而是像云一样散开。
点空白处把点撒上去。越往右越往上的走势就隐隐显出来。
就算点是散开的,
眯起眼也能看出走势。
越往右,
大体上越往上爬。
意思是花的时间多的人,
分数往往更高。
可点太多了,
要准确说出新人的分数很难。
要是能把这走势画成一条线,
不就清楚多了吗?
在点之间画一条线
把走势用一条线表示,最简单的办法
就是画一条笔直的直线。
不是弯弯曲曲的,是直的。
这条线像是穿过
散开的点的正中间。
有的点落在线上方,
有的落在下方,
但整体来看,线代表了它们之间。
这一条线,正是预测的工具。
点点之间的空处,放下线要经过的位置。点两处,就在它们之间画出直线。
画上一条线,
散开的点看着齐整多了。
现在在横轴上随便挑个时间,
沿着线就能读出纵轴的分数。
那就是预测。
没有点的地方,线也给出答案。
可线放哪儿、斜多少,
到现在还是我们随意定的。
定线,另有一条规矩。
斜率和截距定下线
一条直线,由两个数完全定下。
第一个是斜率。
它表示横着走一格,
纵着涨多少。
斜率大,线就陡,
小就缓。
第二个是 y 截距。
它定线和纵轴相交的高度,
也就是起始位置。
定下这两个,线就唯一确定。
这写成 y=ax+b。
用加减按钮改斜率 a 和截距 b。线会变陡、变缓,并上下移动。
把斜率调大,线就变陡,
调小就躺下,你都看见了。
把截距抬高,整条线往上滑,
降低就往下滑。
只用两个数,
就能随意挪动线。
那么对散开的点,
最贴合的 a 和 b
要怎么找?
得有个标准,分出好线和坏线。
偏差最小的线最好
分好线的标准很简单。
看每个点到线的距离。
点离线越远,
就偏得越多。
把所有点的这个距离都加起来,
就得出线整体上偏了多少。
这个偏差之和越小,
线就越贴合点。
所以最贴合的线,
就是偏差之和最小的那条。
用按钮一点点挪线,减小与点的偏差之和。和越小,就越接近最佳拟合。
把偏差之和往小里减,
线就落进点云的正中间了。
它不再明显减小的位置,
就是最贴合的线。
人靠眼睛估着找,
机器却把这个减小的活儿
重复无数次,找得非常准。
要紧的是办法一样。
减小偏差,去找最贴合的 a 和 b。
来理一理
归成一句话,是这样。
成对的点散开时,
在它们之间画一条最贴合的直线。
线由斜率 a 和截距 b 两个数定下,
挑成与点的偏差最小。
往那条线喂个新输入,就能预测结果。
这里只记住一件事。
定线的 a 和 b,
这两个数会在下回学的神经元里,
以权重和偏置的名字再出现。
依次点要点回顾一下。(散开的点 → 画线 → 斜率 a 和截距 b → 减小偏差到最佳拟合 → 权重/偏置预告)
现在你知道了在散开的点之间画线,
用那条线估出接下来的事。
看着复杂的数据,
靠一条直线就清楚多了。
斜率和截距这两个数
造出预测,这个想法
是往后要学的几乎一切的种子。
下回咱们接着看,这一条线
怎样变成神经元,做出更聪明的预测。