seegongsik
我的单词本
seegongsik
人工智能 · 学习的原理

机器“学习”,到底是什么意思

不去写规则,而是让机器从例子里自己找规则。从统计、回归到神经元、神经网络、反向传播,再到嵌入、注意力、LLM、生成,我们一步步跟着看。

18 / 18
01学会,到底是什么意思?
普通程序靠人一条条写好的规则来运行。可世上的事规则太多,全写出来很难。机器学习把路反过来。给它看很多带答案的例子,机器就从这些例子里自己找出共同的模式,也就是规则。一开始它会错,可例子越多,它就一点点改正错的地方,越来越准。靠这磨好的模式,它连一次没见过的新输入也能预测。一句话,不是人来写规则,而是机器从例子里找规则、犯错就改、再去预测新东西,这就是学会的意思。
02用数字看世界,统计的眼睛
统计是把大量数据归成几个数字的眼睛。第一是平均。全部加起来除以个数,得到中间值,告诉你数据大概在哪儿。第二是离散。它说点离中间散得有多远。这两个是一对。就算平均一样,离散不同也是完全不同的数据。挤在一起的一群和散得很开的一群,中间一样,脾气却不同。还有要当心的。一个跑得很远的点,离群值,很容易把平均拽着走。所以别只信中间一个值,离散和跑偏的点也要一起看。一句话,用中间和离散两个数字一眼看懂数据,就是统计。
03应对不确定,概率
概率是把一件事有多大可能,用0到1之间的数字标出来。0就是几乎不发生,1就是几乎一定,0.5就是一半一半。像骰子或硬币那样,试很多次,每种结果出现的比例就一点点靠近真正的概率。试一两次会忽高忽低,但试得越多越稳。两件事一起发生的可能性,靠把各自的可能性相乘来估。因为两边都得有可能,合在一起才有可能。而在不确定的时候,我们挑最有可能的那一边。AI也一样。它不断定自己知道答案,而是给几个候选打上概率,挑出最有可能的那个答案。一句话,概率把不确定当成数字来对待,让我们挑出最有可能的那一边。
04在点之间画线,回归
回归是在散开的点之间画出一条最贴合的直线。因为那条线是 y=ax+b,喂进一个新输入,就能预测结果。定这条线只有两样东西。斜率 a 定输入每增加一,结果涨多少;y 截距 b 定线在上下哪个位置。最贴合的线,就是与点的偏差最小的那条,也就是从点到线的距离之和最小。你用眼睛把偏差减小,慢慢靠近那条线。斜率 a 和截距 b 这两个数,以后会原样接到神经元的权重和偏置上。
05分清是哪一群,分类
分类就是分清某样东西属于哪一群。回归猜一个值,分类则回答它是哪一群。办法很简单。在两群之间画一条边界线,把它们分到两边。来了新的点,只看它落在边界的哪一边,群就定了。不用去量,一个位置就分清。要是有三群以上,多画几条边界,分成更多块就行。一句话,在点之间画边界,新的点按它在边界的哪一边来分,这就是分类。
06量一量错了多少,损失
损失是用一个数量出模型错了多少。每个点都有预测和正确答案之间的差,也就是竖直距离。把这些距离全加起来,整体错了多少就聚成一个数。那就是损失。损失大,说明线和点偏得多;小,就说明贴得好。所以做出好模型,就等于把损失变小。把线挪来挪去,挑损失这个数往下掉的方向就行。像这样把损失越减越小,正是学习。下回我们看看该往哪个方向减损失,怎么找那条路。
07一点点改着往下走,梯度下降
梯度下降是为了降低损失,靠感觉坡度,把值朝更低的那一侧一步步改过去的办法。损失曲线像中间最低的山谷,我们从现在站的地方看脚下的坡度,把值朝往下的那侧挪一点。这一步的大小叫步幅,也就是学习率。步幅太大就会跨过谷底、弹到对面去;太小则虽然在往下,却很慢。用合适的步幅反复迈步,就会靠近谷底,也就是损失最小的地方。一句话,感觉坡度一点点往下走,把步幅选好,这就是梯度下降。
08模仿大脑的一格,神经元
人工神经元给每个输入乘上权重,再全加起来。这个样子就是回归里见过的 ax+b。那里的斜率 a 在这里就是权重。权重大就重重地听那个输入,权重小就轻轻地听。加出来的和超过门槛,神经元就点亮(1),过不去就灭着(0)。一开始权重很糙,常常出错。这时就像梯度下降,按错的程度把权重一点点改。定好该升还是该降的方向,一步一步挪,神经元就越猜越准。一句话,把输入乘权重再加,用门槛点亮,错了就调整,这就是神经元学习的办法。
09把神经元层层叠起,神经网络
神经网络是把许多简单的神经元层层叠起、连起来。每一层把上一层的输出当作输入,抓住更大的特征。前面的层看到小碎片,后面的层把碎片汇起来看到更大的形状。有一样东西必不可少。层与层之间必须有一个让信号弯曲的非线性步骤。没有弯曲步骤,只是一味地相加,不管叠多少层,最终都会并成一条直线,跟一层一样。有了弯曲步骤,叠层才有意义,网络才能学到曲线那样复杂的边界。一句话,把神经元层层叠起,中间放一个弯曲步骤,网络就能学到复杂的模式。这就是神经网络。
10把错误倒着追回去,反向传播
反向传播是神经网络出错时倒着追错误来自我修正的办法。先把信号往前流给出预测,再跟正确答案一比,用损失量出错了多少。接着是核心。把这个损失从输出倒着流回输入那头,算出每个权重对错误贡献了多少、该担多少责任。就像顺着骨牌倒着追。最后按这份责任,用梯度下降把每个权重稍微改一点。责任大的权重改得多,责任小的改得少。把这个往前预测、倒着追、再调整的循环反复成千上万次,网络的预测就一点点靠近正确答案。一句话,反向传播就是倒着追错误、分清谁的责任,再按那份责任去改。
11死记硬背与真正理解,过拟合
过拟合就是模型把训练数据背了下来,于是对新数据变得很弱。一条把每个点都穿过去的弯弯曲曲的曲线,训练分数考一百,可新点一来就偏得离谱。真正的理解是抓住贯穿整体的一般规律,而不是一个个点。所以我们把数据分成三份。用训练数据来学,用验证数据做中途检查,把测试数据一直藏到最后只看一次。在没见过的数据上做得好,才是真本事。模型太简单就抓不到规律(欠拟合),太复杂就只会背(过拟合)。两者之间恰到好处的程度泛化得最好。一句话,让它抓规律而不是死背,再用没见过的数据来量本事。
12好材料才有好 AI,数据
AI 的实力跟模型一样靠数据,也许更靠数据。第一,垃圾进,垃圾出。用贴错标签或偏向一边的数据来学,机器会把那些毛病也照样学过来。第二,给它干净、均衡的好材料,同一台机器就能好好地学。第三,要挑选适合问题的特征。要猜房价,面积或位置有用,可大门的颜色没帮助。无关的特征反而碍事。第四,好数据越多越好。例子越多,机器越不容易被偶然的巧合带偏,能抓住真正的模式。一句话,把干净、不偏的数据,用适合问题的特征,足量地给它,这就是好 AI 的根基。
13看图像的眼睛,CNN
CNN 是看图像的神经网络。首先,照片其实是一张挤满亮度数字的格子。亮就是大数,暗就是小数。CNN 把一个小滤镜,也就是放大镜那样的小板,放到图像的一个窗口上,给那里有没有它要找的特征打分。把同一个滤镜在格子上一格一格地挪,就做出一张特征图,不管那个特征落在画面哪里都能找到。位置挪了也不怕,因为是同一个滤镜在找。再把这样的层叠上好几层,前面的层抓小边缘,上面的层把边缘汇成眼睛或鼻子,更上面的层再把它们汇成整张脸。层越往上,抓到的特征越抽象。一句话,把照片看成数字格子,用小滤镜扫看找特征,把这些层叠起来抬高抽象度,这就是 CNN。
14把词变成数字,嵌入
嵌入就是把词变成意义坐标。坐标不过是一串数字,所以计算机能处理。关键的约定是把意思相近的词放在一起。于是 king 和 queen、狗和猫彼此挨得近,毫不相干的词则离得远。因为是坐标,就能相加相减,而这种运算居然带着意义。拿 king 减去 man 再加上 woman,就落在 queen 附近。而且这招不只用在词上。图像、声音,甚至用户,都能照样变成坐标,把相似的东西放近,计算机就能用距离来量相似度。一句话,把词变成坐标、把相近的意思聚到一起就是嵌入,这是计算机处理意义的第一步。
15把注意力放在要紧处,注意力机制
注意力机制就是在一句话里,对眼前这个词来说要紧的词多加注意的本事。它不是同等地看每个词,而是给更相关的词更大的权重。把这些权重全收起来,再分配成总和为一。所以同一个词,周围一变,解读也变。在 'Apple' 旁放 'eat',意义坐标就滑向水果;放 'stock',就滑向公司。多义词的意思由上下文来定,正是靠这个。一句话,对要紧处多加注意,把这份注意拆成权重,让上下文来定意义,这就是注意力机制。
16猜下一个词的机器,LLM
LLM 是看着前面的语境,用概率猜下一个词的机器。对每一个可能来的候选词,它都打出一个有多像样的概率,再从中挑一个高的。把挑中的词接到句尾,用变长的句子再猜下一个词。这样一个词一个词地反复,就造出一长段文字。前面的词一变,下一个词的概率也跟着变,而这种挑选要看哪段前文的本事,正是你前面学过的注意力。又因为它是用海量文字训练来把这一件事做好的,没人要求的本事也跟着冒了出来。它会摘要、会翻译、会写代码。这种自己冒出来的本事,就叫做涌现。不过要记住。LLM 并不知道真相,它只是挑出最像样的下一个词。所以它会很自信地出错。它的局限,下一课再讲。
17造出新东西,生成式 AI
生成式 AI 是用学到的模式造出新东西的 AI。它不是把背下来的原样复制,而是用从无数例子里学来的模式,搭出新的组合。它能造的不只有文字。图像、音乐、视频也都能造。所以生成式 AI 比写字的 LLM 是个更宽的词。造图像时,常常从沙沙的噪声开始。把那些模糊的点一点点理顺,画面的样子就渐渐浮现。然后人来给指示。把要造什么用话写下来,就叫提示词。同一个 AI,换了提示词,结果的方向就不一样。一句话,生成式 AI 用学到的模式造新东西,不只造文字,也造图像和音乐,从噪声理顺造出画面,靠提示词定方向。
18聪明的 AI,负责任的 AI
AI 强大但不完美。第一,AI 是从数据里学的,数据要是偏向一边,AI 的判断也跟着偏。这就是偏见。第二,AI 是靠概率把像样的话接起来,所以它会把不知道的事当真事一样、很自信地编出来。这就是幻觉,所以我们得随时核对最新事实和出处。第三,同样的技术能用来行善,也能用来作恶。决定好坏的不是工具本身,而是使用的方式。所以需要负责任的 AI。人要核对结果,把怎么做出来的讲清楚透明,留意它对所有人是否公平。一句话,知道偏见、幻觉、滥用这些局限,再加上人来核对着用,这就是负责任的 AI。
如果有帮助,请支持我们