seegongsik
我的单词本
人工智能

造出新东西,生成式 AI

前面我们学过,写字的 AI 按概率挑出下一个词,再串起来。可 AI 能造的只有文字吗? 它能画出谁都没见过的画,还能谱出新的旋律。它不是把背下来的原样拿出来,而是用学到的模式造出新东西。这样会创造的 AI,就叫生成式 AI。

01

不是背诵,而是造新东西

前面我们学过写字的 AI。
它按概率挑出下一个词,
一个词一个词地串起来。
不过有一点要交代。
AI 不是把见过的句子背下来,
再原样拿出来。
它从无数例子里学会模式,
再用这些模式,当场造出
一个从没有过的新组合。

学到的碎片
红色的圆圆的小小的发光的屋顶月亮山丘上水边林中天边
点按钮把碎片重拼成新东西
0 / 8

点按钮,把学到的碎片重新拼成新东西。同样的碎片,每次点都拼出不同的新组合。不是把记忆拿出来,而是造新东西。

同样的碎片,每次点
却给出不同的结果。
要是拿出一个背好的答案,
每次就该一模一样。
用学到的模式重拼碎片,
每次才有新东西出来。
这样造出新东西,
就叫生成。
可它能造的只有文字吗?

02

不只文字,图像和音乐也行

造文字的 AI 我们叫它 LLM。
可生成式 AI 比它更宽。
学了大量图画例子的 AI,
造出新的图画。
学了歌曲的 AI 谱出新旋律,
学了视频的 AI 也能造短片。
学了什么,
造出的东西就不一样。
LLM 只是其中管文字的一支。

要造什么
写出新句子
造文字的这一支,正是 LLM
LLM (text)

点文字、图像、音乐、视频按钮来切换。生成式 AI 看学了什么,这些都能造,文字(LLM)只是其中之一。

不管选哪个,
底下的想法都一样。
用学到的模式造新东西。
文字也好图画也好音乐也好,
都从无数例子里学会模式,
再用模式搭出新组合。
那图画到底是怎么造的呢?
它用的办法跟文字
一个词一个词地串,有点不一样。

03

从沙沙的噪声到画面

造画面的 AI 很奇妙,
不是从干净的白纸,
而是从沙沙的噪声开始。
就像电视信号断了时,
满屏幕的那些点。
它从那里把点一点点理顺。
模糊的点一步步被整理,
某个样子就开始浮现。
反复理顺,画面就清晰起来。

沙沙的噪声 (开始)
0 / 5

每点一次理顺按钮,沙沙的噪声格子就整理一步。模糊的点渐渐浮成画面的样子。(步骤固定,谁来都是同样的结果)

噪声变成画面了吧。
它不是一下子就蹦出来,
而是一点点理顺才清晰的。
AI 早已从无数例子里学会,
该把哪些点、怎么整理,
才能更接近真正的画面。
它用学到的那种感觉理顺噪声,
造出新的画面。
可要画什么,由谁来定呢?

04

人来给指示,提示词

AI 不是自己随便造什么。
人用话告诉它要造什么。
这样用话写下的指示,
就叫提示词。
写猫,就朝猫去;
写宇宙,就朝宇宙去,
理顺的方向就变了。
同一个 AI,换了提示词,
出来的结果就不一样。

选个提示词
朝猫的方向理顺
即便从同样的噪声开始,按指示画面也会变
prompt: "猫"

点一下换提示词。即便从同样的噪声开始,按你写的指示,理顺所朝向的画面也会变。是人来给方向。

换了提示词,
结果的方向一下就变了吧。
AI 有创造的本事,
人来定要造什么。
两者算是配合默契。
好的指示写得越清楚,
就越接近你想要的结果。
所以写什么、怎么写,
就成了用生成式 AI 的本事。
现在来把整件事理一理。

05

来理一理

归成一句话,是这样。
生成式 AI 用学到的模式造新东西。
不是复制背下来的东西。
造的不只是文字。
图像、音乐、视频也能造。
所以它比 LLM 是个更宽的词。
图像从噪声开始,
一点点理顺成画面。
然后人用提示词给方向。

依次点要点回顾一下

依次点要点回顾一下。(用学到的模式造新东西 -> 不只文字还有图像音乐 -> 从噪声理顺成画面 -> 提示词给方向)

现在你知道生成式 AI 是什么了。
它用学到的模式,把文字、图画、音乐
都重新造出来,是一件工具。
它理顺噪声造出画面,
靠人的提示词定方向。
不过造得这么好,
也可能造出跟真的
难以分辨的假东西。
下回咱们看看怎么负责任地用它。

一句话总结生成式 AI 是用学到的模式造出新东西的 AI。它不是把背下来的原样复制,而是用从无数例子里学来的模式,搭出新的组合。它能造的不只有文字。图像、音乐、视频也都能造。所以生成式 AI 比写字的 LLM 是个更宽的词。造图像时,常常从沙沙的噪声开始。把那些模糊的点一点点理顺,画面的样子就渐渐浮现。然后人来给指示。把要造什么用话写下来,就叫提示词。同一个 AI,换了提示词,结果的方向就不一样。一句话,生成式 AI 用学到的模式造新东西,不只造文字,也造图像和音乐,从噪声理顺造出画面,靠提示词定方向。
人工智能
如果有帮助,请支持我们