seegongsik
我的单词本
人工智能

好材料才有好 AI,数据

前面我们学过机器看例子、把它们分成群。可要是那些例子是垃圾呢? 就算是同一个模型,喂它什么材料,结果也会完全不同。其实做好 AI 的秘诀,往往不是更聪明的模型,而是更好的数据。拿做菜来说,材料比手艺更靠前。

01

垃圾进,垃圾出

机器只看我们给的例子来学。
所以例子要是错的,
它会把那些错误也照样学过来。
把猫的照片标成狗,
机器就会硬说猫是狗。
只给它偏向一边的例子,
它就相信世界就是那么偏的。
用连人都看得出是垃圾的资料,
再好的机器也只学到垃圾。

准确度96%
用干净的例子,机器分得很好
0 / 6

把错的例子一个个放进去。贴错标签的资料放得越多,机器的判断就越离谱。

错的例子越堆越多,
机器的答案就乱了套。
机器自己分不出对错,
只是相信我们给的资料。
所以贴错标签或偏向的资料,
会原样变成一个坏习惯。
换句话说,光是把数据修好,
同一台机器就能聪明得多。

02

给好材料,就能好好学

那么好材料是什么样的呢?
第一,标签要准确。
猫就是猫,狗就是狗。
第二,不能偏向一边。
猫的照片给一大堆,狗只给几张,
机器就几乎认不出狗。
两边都均匀地给它看,才学得平衡。
第三,搅浑同一件事的杂音要少。
模糊的、乱混进来的资料最好剔掉。

标签错误: 2均衡: 6 / 2
准确度58%
标签错了,资料还偏向一边

点按钮,把乱七八糟的资料换成干净、均衡的资料。材料一变好,机器的准确度就上去了。

机器一点没动,
准确度却一下子上去了。
变的只有材料。
把标签修对、两边均匀填满,
同一台机器就好好地学了。
所以实际工作里,动模型之前,
人们先在把数据擦干净上下功夫。
好材料是好结果的一半。

03

挑选适合问题的特征

数据干净了,还剩一件事。
要定下让它看什么来判断。
这样挑出来的线索就叫特征。
想想猜房价这个问题。
房子的面积或位置跟价钱缠得很深。
又大、地段又好,价钱就涨。
可大门的颜色呢?
跟价钱几乎没关系。
这种无关的特征反而把判断搅浑。

准确度40%
挑选跟房价相关的特征

挑选用来预测房价的特征。放进面积和位置,准确度上升;放进大门颜色这种无关的,反而下降。

每挑对一个特征,准确度就上升。
反过来放进无关的颜色,就下降了。
特征多不等于一定好。
要挑跟问题真正相关的线索。
对的特征是通往答案的近路,
错的特征是把路搅乱的杂音。
好好挑选给它看哪些线索,
这也是做出好数据的重要活儿。

04

好数据越多越好

材料干净、特征也对的话,
这时数量就要紧了。
例子要是只有几个,
机器很容易被偶然混进来的
一两个特殊情况带偏。
例子非常多的时候,
那种巧合就被平均淹没、变弱,
而经常出现的真正模式越发清晰。
所以干净的数据越多越靠得住。

准确度62%
例子少,边界被偶然带得直晃
例子数: 4

点增加数据量的按钮。点越多,偶然的晃动就平息,边界稳下来,准确度上升。

数据加得越多,
边界越稳,准确度越高。
少的时候一个点都让它晃,
多起来摇晃就平息了。
当然,光加数量不是答案。
垃圾收得再多也还是垃圾。
只有数据干净、不偏的时候,
越多越好这句话才说得通。
质在先,量在后。

05

来理一理

归成一句话,是这样。
机器只能学到我们给的数据那么好。
垃圾进,垃圾出,
给干净、均衡的材料,它就好好地学。
要挑选适合问题的特征,
无关的线索反而碍事。
好数据越多越靠得住,
但质在先,量在后。
好材料造就好 AI。

依次点要点

依次点要点回顾一下。(垃圾进垃圾出 -> 干净材料学得好 -> 挑对的特征 -> 好数据越多越好)

现在你知道了数据为什么那么重要。
人们常常想到更聪明的模型,
可真正定结果的,往往是材料。
把它擦干净,不偏地收集,
挑适合问题的特征,足量地给它。
这件看着平常的活儿,就是好 AI 的根基。
下回咱们接着看,用这样准备好的数据,
机器到底学得有多好,
我们又怎么去衡量。

一句话总结AI 的实力跟模型一样靠数据,也许更靠数据。第一,垃圾进,垃圾出。用贴错标签或偏向一边的数据来学,机器会把那些毛病也照样学过来。第二,给它干净、均衡的好材料,同一台机器就能好好地学。第三,要挑选适合问题的特征。要猜房价,面积或位置有用,可大门的颜色没帮助。无关的特征反而碍事。第四,好数据越多越好。例子越多,机器越不容易被偶然的巧合带偏,能抓住真正的模式。一句话,把干净、不偏的数据,用适合问题的特征,足量地给它,这就是好 AI 的根基。
人工智能
如果有帮助,请支持我们