好材料才有好 AI,数据
前面我们学过机器看例子、把它们分成群。可要是那些例子是垃圾呢? 就算是同一个模型,喂它什么材料,结果也会完全不同。其实做好 AI 的秘诀,往往不是更聪明的模型,而是更好的数据。拿做菜来说,材料比手艺更靠前。
垃圾进,垃圾出
机器只看我们给的例子来学。
所以例子要是错的,
它会把那些错误也照样学过来。
把猫的照片标成狗,
机器就会硬说猫是狗。
只给它偏向一边的例子,
它就相信世界就是那么偏的。
用连人都看得出是垃圾的资料,
再好的机器也只学到垃圾。
把错的例子一个个放进去。贴错标签的资料放得越多,机器的判断就越离谱。
错的例子越堆越多,
机器的答案就乱了套。
机器自己分不出对错,
只是相信我们给的资料。
所以贴错标签或偏向的资料,
会原样变成一个坏习惯。
换句话说,光是把数据修好,
同一台机器就能聪明得多。
给好材料,就能好好学
那么好材料是什么样的呢?
第一,标签要准确。
猫就是猫,狗就是狗。
第二,不能偏向一边。
猫的照片给一大堆,狗只给几张,
机器就几乎认不出狗。
两边都均匀地给它看,才学得平衡。
第三,搅浑同一件事的杂音要少。
模糊的、乱混进来的资料最好剔掉。
点按钮,把乱七八糟的资料换成干净、均衡的资料。材料一变好,机器的准确度就上去了。
机器一点没动,
准确度却一下子上去了。
变的只有材料。
把标签修对、两边均匀填满,
同一台机器就好好地学了。
所以实际工作里,动模型之前,
人们先在把数据擦干净上下功夫。
好材料是好结果的一半。
挑选适合问题的特征
数据干净了,还剩一件事。
要定下让它看什么来判断。
这样挑出来的线索就叫特征。
想想猜房价这个问题。
房子的面积或位置跟价钱缠得很深。
又大、地段又好,价钱就涨。
可大门的颜色呢?
跟价钱几乎没关系。
这种无关的特征反而把判断搅浑。
挑选用来预测房价的特征。放进面积和位置,准确度上升;放进大门颜色这种无关的,反而下降。
每挑对一个特征,准确度就上升。
反过来放进无关的颜色,就下降了。
特征多不等于一定好。
要挑跟问题真正相关的线索。
对的特征是通往答案的近路,
错的特征是把路搅乱的杂音。
好好挑选给它看哪些线索,
这也是做出好数据的重要活儿。
好数据越多越好
材料干净、特征也对的话,
这时数量就要紧了。
例子要是只有几个,
机器很容易被偶然混进来的
一两个特殊情况带偏。
例子非常多的时候,
那种巧合就被平均淹没、变弱,
而经常出现的真正模式越发清晰。
所以干净的数据越多越靠得住。
点增加数据量的按钮。点越多,偶然的晃动就平息,边界稳下来,准确度上升。
数据加得越多,
边界越稳,准确度越高。
少的时候一个点都让它晃,
多起来摇晃就平息了。
当然,光加数量不是答案。
垃圾收得再多也还是垃圾。
只有数据干净、不偏的时候,
越多越好这句话才说得通。
质在先,量在后。
来理一理
归成一句话,是这样。
机器只能学到我们给的数据那么好。
垃圾进,垃圾出,
给干净、均衡的材料,它就好好地学。
要挑选适合问题的特征,
无关的线索反而碍事。
好数据越多越靠得住,
但质在先,量在后。
好材料造就好 AI。
依次点要点回顾一下。(垃圾进垃圾出 -> 干净材料学得好 -> 挑对的特征 -> 好数据越多越好)
现在你知道了数据为什么那么重要。
人们常常想到更聪明的模型,
可真正定结果的,往往是材料。
把它擦干净,不偏地收集,
挑适合问题的特征,足量地给它。
这件看着平常的活儿,就是好 AI 的根基。
下回咱们接着看,用这样准备好的数据,
机器到底学得有多好,
我们又怎么去衡量。