你输入"一只戴草帽的橘猫,趴在窗台上看雨",十几秒后,屏幕上就出现一张这样的图。AI 绘画干的这件事,用一句大白话说就是:它学过海量"图配文字说明"之后,按你的描述,从一团随机噪点开始,一步步把图"画"出来——不是搜来的,也不是拼来的。

不信可以当场做个实验:同一个工具、同一句话,再点一次生成。出来的会是另一张图——橘猫换了个姿势,草帽变了颜色,窗外的雨景也不一样。在常见的随机生成设置下,每次起点不同,结果就可能不同。不过,搜图也能返回不同结果,固定随机种子和其他条件的生成也可能重复;光凭两张图不同,不能判断背后是不是生成。

它到底是怎么"画"出来的

以常见的扩散类文生图为例,关键是这么几步:

1. 先"上学":从大量图片和文字说明里学规律。 训练阶段,模型(一种从海量数据里学规律的计算结构,详见"机器学习"词条)会学习大量图文样本——"一只猫坐在窗台上""雨天的街道",如此反复。读得多了,它逐渐摸清文字和画面之间的对应规律:"橘猫"两个字,大概对应什么颜色、什么形状的像素组合。注意,它存下的是这些规律,并不是一个逐张检索的图库;不过模型也可能记住并复现部分训练样本。

2. 开工时,先撒一把"沙子"。 你输入描述后,它不是从白纸画起,而是从一团随机噪点开始——类似老电视没信号时的满屏雪花。

3. 一遍遍"去噪":每改一下,都朝那句话靠近一点。 接下来模型做几十轮修改,每轮只干一件事:看看眼前这团东西,往哪个方向改一点,会更像"戴草帽的橘猫在窗台上看雨"该有的样子。改着改着,噪点里浮出轮廓,轮廓长出细节,最后变成一张清晰的图。这套"从噪点里把图一点点找出来"的做法,就是眼下主流的"扩散模型"。

4. 随机起点变化时,结果通常也跟着变化。 这就是开头那个实验的答案:起点是随机的,后面每一轮又顺着起点往下走,同一句话在随机设置下生成十次,通常会得到不同的图。

AI 绘画属于"生成式AI"——"生成"两个字,正是它和搜图工具的分界线:搜图是把别人画好的找给你,生成是给你现画一张。

一眼看懂 / 示意图

常见扩散过程:从噪点到图像

常见扩散过程:从噪点到图像随机状态轮廓浮现结构与细节图为过程示意;并非模型实际中间帧
  1. 01提示文字

    戴草帽的橘猫

  2. 02逐步生成

    从随机状态走向符合描述的图

程序绘制的过程示意,不是某模型的实际中间输出;部分模型在潜在空间生成。

为什么说它不是"高级拼图"

很多人第一反应是:它肯定是把网上的图剪碎了再拼起来,不然哪能画得这么快、这么像?

这个猜想很自然,但对不上号。拼图用的是现成的块:块从哪张图剪下来,成品里就带着哪张图的碎片。而 AI 绘画是从噪点开始、一个像素一个像素重新生成的,通常不是直接从训练图剪下一块块拼贴;但这不保证结果绝不接近或复现某张训练图。打个比方:它更像一个临摹过无数画作后凭印象作画的人,而不是拿剪刀浆糊做剪贴画的人——前者画的是"学会的感觉",后者用的是别人的纸。

不过有一点要承认:正因为它"临摹"过海量画作,谁的风格都沾一点。你说"画一张某某画师风格的图",它真能画出那个味道——这正是眼下争议最集中的地方(放到最后说)。但"风格像"和"复制某张图"是两回事:它画得出梵高的笔触,不等于把《星月夜》的碎片贴进了你的图。

画得像,不等于"懂"

AI 画的图可以以假乱真,但它时不时会露馅:一只手六根手指、筷子穿进了碗里、招牌上的字是一堆鬼画符、镜子里外的人动作对不上。

这些翻车暴露了一个事实:它学的是"什么样的像素组合经常出现在'手'附近",而不是"人有五根手指""筷子不能穿碗"这类关于世界的知识。它生成看似合理的图案,不保证每处都符合解剖、物理或文字规则。部分模型已经能生成正确文字,但也仍会写错或漏字。新一代模型在这些地方进步很快,错得少了,但犯错的性质没变:它是靠统计规律在"蒙",只是蒙对的概率越来越高。

所以别拿人的标准要求它"画对"。它是很好的灵感来源和出图工具,但涉及"必须准确"的画面——产品结构、医学示意、新闻现场——它画的只能当参考,不能当证据。

用之前,知道这两件事

第一,版权的官司还没打完。 训练用的海量图片里,很多并没有经过画师和摄影师同意,相关纠纷在不同地区陆续审理,已有部分判决,但并未解决所有版权问题;各国对"AI 生成的图算不算作品、归谁"的认定也不一致。现状就是规则还在形成中:个人使用也要尊重他人权利,拿 AI 图去商用之前,值得看一眼所用平台的条款和当地的规定。

第二,别拿它做以假乱真的事。 用 AI 图冒充新闻现场、冒充满手绘作品去接单、生成真实人物的脸去骗人——这些已经不是"会不会用工具"的问题,而是欺骗,严重的会触犯法律。AI 生成假脸假画面这条线,和"深度伪造"词条讲的是同一件事的两面。