跳到正文
AI 知识地图 0.18 · 2026-07-30
关于与纠错文字目录 / Search
理解原理

图像生成

把一句话变成一张没人拍过的图

Image Generation · 文生图 · Text-to-Image

建议 20–30 分钟 · 中级 · 需要:了解「扩散模型」「嵌入/多模态」

核心命题 图像生成是根据文本(或其它条件)造出一张全新图像的任务。它要同时办成两件事:读懂文字(并把文字和图像对齐),和把图画出来(当今主流引擎是扩散模型)。理解它的关键,是分清「任务」和「引擎」,并看清它现在还做不好什么。
读完这一页,你应该能自己回答:
  • 是什么——AI「画图」到底在干嘛,是拼贴现成图吗。
  • 两件核心事——一句话变成一张图,中间要解决什么。
  • 引擎是什么——具体靠什么把图画出来。
  • 怎么更可控——只给一句话太粗,怎么精确控制。
  • 还做不好什么——现在的图像生成有哪些老大难。
贯穿全页的最小例子 输入「一只戴帽子的柯基,油画风格,坐在海边」,期待得到一张符合这句话、且此前不存在的图。全页看它怎么把这句话变成画,以及为什么「让图里准确写出一行字」反而比画柯基更难。

1什么是图像生成直觉

本节回答:AI「画」一张没人拍过的图,它是从图库里拼出来的吗?

所谓图像生成,可以理解为“按条件创造图像候选”:它解决的是“没有现成图片,却希望得到符合描述的新画面”这一问题,而不是从图库里找一张最像的图。

输入可以是一段文字,也可以再带参考图、草图或姿势;输出是一张或多张像素图像。以“戴帽子的柯基”为例,系统先把输入条件转换成内部表示,再根据训练中学到的图像规律采样一个新表示,最后把它解码成可见图片。这里的采样是从许多可能画面中选出一次结果,因此同一句话多运行几次,输出可以不同。

结果怎样解释 生成结果表示“模型认为这种画面与条件相容”,不表示画面中的事件真的发生过,也不表示其中的文字、常识或细节必然正确。

边界:输出通常不是训练集中原样存在的图片,但模型仍可能记住并复现训练片段;所以“生成了一张新图”不能证明它绝对原创、事实正确或可以不受限制地使用。

2它要同时办成两件事工程

「一句话 → 一张图」,中间其实要跨过两道坎。

两阶段生成描述了从“理解要求”到“形成画面”的完整过程,用于解决文字含义与图像像素之间不能直接一一对应的问题。它的输入是提示词和可选控制条件,中间输出是机器可使用的条件表示,最终输出才是图像候选。

要办的事解决什么靠什么
① 读懂文字把「戴帽子的柯基、油画、海边」理解成图像层面的意思文本理解 + 图文对齐(见「嵌入」「CLIP」「多模态」)
② 把图画出来在像素、潜变量或视觉 token 空间生成,再解码为协调的新图扩散、自回归等生成引擎

它怎样工作:系统先把“柯基、帽子、海边、油画”编码成条件表示,再让生成引擎依照这些条件形成图像表示,然后解码成图片,最后逐项验收对象、关系与风格。图文对齐是让文字和对应画面在内部表示中靠近;视觉 token则是模型处理图像时使用的离散小单元,可以把它暂时理解为“图像版词块”。

分清「任务」和「引擎」 图像生成是任务;扩散模型是当前实现它最主流的引擎(早年还有 GAN,也有自回归等其它路线)。任务不变,引擎会换——这也是这个领域进步这么快的原因。
文本条件柯基 · 帽子 · 海边文本编码器条件表示 c生成引擎噪声/视觉 token逐步受 c 条件化解码成图再做验收语义对齐决定“画什么”,生成引擎决定“怎样形成图像表示”
图 1 文生图不是一句文字直接变像素。文本先成为条件表示,生成引擎在像素、潜空间或视觉 token 中采样,再解码并接受独立验收。
运行示例:固定 4 个验收项样本 1样本 2
柯基主体
帽子戴在头上✗(漂浮)
海边场景
油画风格△(偏照片)
“整体相似”会掩盖属性绑定错误 两张图都可能获得很高的图文相似度,但只有样本 2 满足帽子与柯基的空间关系。评测要拆成对象、数量、属性、关系、文字和风格,而不是只看一分或挑最好看的样例。

结果与边界:某个候选整体上很像提示词,只说明大方向可能对齐,不能证明每个对象、数量和空间关系都正确。这个“两阶段”解释适合建立任务直觉,但不同模型会把编码、生成和解码组合成不同结构,不能把图中的方框当成所有系统都必须采用的固定部件。

3引擎:当今主要是扩散直觉

具体靠什么把图画出来?

扩散模型指的是通过反复去噪来生成数据的引擎,它解决的是“怎样从随机起点得到既自然又符合文字要求的图像”。这里的噪声可以想成没有可辨对象的随机雪花;条件就是用来约束生成方向的文字或控制图。

输入是一团随机噪声、当前去噪步数和文字条件,每一步的输出是稍微更有结构的中间图像,最终输出才是完整图片。系统先预测当前噪声中哪些变化更像目标画面,再去掉一部分噪声,然后把结果送入下一步;重复多次后,“柯基、帽子、海边”的结构逐渐出现。

怎样读结果 一次运行得到的是随机起点下的一个候选,不是提示词的唯一标准答案。更换随机种子就像换一个随机起点,通常会得到另一种构图。

边界:增加去噪步数不一定持续提升质量,也不能保证计数、文字或事实正确。扩散只是当前主流路线,不等于图像生成本身;自回归则是按顺序预测下一个视觉单元,像逐词写句子那样逐块形成图像,两种路线各有速度与控制上的取舍。

4完整示例:怎么让它更听话案例推演

只给一句话,控制太粗——想要精确的构图、姿势、局部修改,怎么办?

可控生成所做的,是把结构约束加到文生图过程里,用于解决“文字说得对,但位置、姿势或局部细节仍不可控”的问题。它的输入是在提示词之外增加姿势骨架、深度图、线稿或局部遮罩,输出是既满足文字语义、又尽量服从这些约束的图像。

  • 可控生成:在文字之外再加额外条件——一张线稿、一个人体姿势、一张深度图,让生成严格贴着它来(如 ControlNet);或只重绘图里指定的一块(局部重绘),其余保持不动(见「可控生成」)。
  • 图像编辑:不是从零生成,而是在已有图上按指令改(换背景、去除某物、扩图),实用场景的主力(见「图像编辑」)。
步骤输入本步要检查的输出
1 确定目标“红外套人物站在桥左侧,背景是雨夜城市”对象、位置、服装和场景被拆成可检查条件
2 约束构图人物姿态骨架与桥面深度图人物位置和透视遵循控制图
3 生成候选同一条件下固定 4 个随机种子分别检查贴题、自然度和候选间多样性
4 局部修订只遮罩错误的手部区域手部改善且脸、衣服、桥面未被意外改写

它怎样工作:先把模糊愿望拆成可检查条件,再用结构图约束整体构图,然后生成多个候选,最后只遮罩错误区域做局部重绘。随机种子是产生随机起点的编号;固定它有助于比较改动前后差异,但这个编号本身不代表质量高低。

怎样解释结果:若只有个别候选失败,说明随机采样造成波动;若四个候选都在同一位置失败,更像是条件表达不清、约束冲突或模型没有学好这种组合,应回查输入,而不是只继续“抽卡”。

边界:控制条件越多并不一定越好。若姿态图要求人物站在左边、文字却要求人物在右边,系统无法同时完全服从;局部重绘也可能连带改变邻近区域,因此必须明确优先级并复查未遮罩部分。

一句话 纯文生图是「说什么画什么」,可控生成和编辑则给了你更细的方向盘——从「碰运气」走向「可精确调」。

5它现在还做不好什么工程

能力随模型快速变化,下面不是永久缺陷清单,而是部署时应持续评测的高风险维度。

能力边界评测记录模型在不同失败类型上的表现,用于解决“展示图很好看,却不知道系统在真实任务中会在哪里失灵”的问题。它的输入是一组覆盖文字、计数、空间关系、一致性和事实性的测试提示,以及每条提示规定的采样次数;输出是各类错误的成功率、失败率和代表案例。

  • 图中文字与版式:新模型已明显改善短文本,但长文、多语言、精确排版与可编辑字体仍需逐模型评测。
  • 组合与复杂结构:手部只是一个例子;更普遍的是计数、空间关系、遮挡、对称和多对象属性绑定可能出错。
  • 一致性:让同一个角色在多张图里保持长相一致,很难。
  • 事实性:它生成的是「看起来对」的图,不是「真的准确」的图——和大模型的幻觉同源。要求科学准确的示意图时尤其要核对(见「幻觉」)。

它怎样工作:先为每个高风险维度设计一组固定提示,再让同一模型按统一分辨率和采样预算重复生成,然后由明确的标注规则记录错误类型,最后比较不同维度和版本。看到一张成功图,只说明该次采样成功;某一类提示在多次生成中仍频繁失败,才说明它是可重复的能力短板。

适用边界 这份清单不能永久代表所有模型,也不能用一个模型的结果替另一个模型背书。模型版本、语言、画幅和编辑工具改变后都要重新评测;高风险用途还必须由领域人员核对事实。

6怎么评估:好看、贴题与安全不是一个分数工程

“这张图质量高”到底是在说什么?

多维评估比较的是“质量”的不同侧面,而不是寻找一个万能总分,用于避免一张好看的图掩盖贴题错误、身份漂移或安全风险。它的输入是固定提示集、模型版本、随机种子策略、采样预算和人工评分规则;输出不是一个万能总分,而是各维度分数、失败类型和高风险案例。

至少要分开评估:感知质量是画面是否自然,提示对齐是对象、关系和文字是否符合要求,多样性是候选是否只是近似复制,身份一致性是同一角色跨图是否保持特征,事实与安全则检查内容是否可信、合规。人工盲评是让评价者不知道图片来自哪个模型,减少品牌与顺序偏见;安全红队是主动设计高风险请求来寻找系统漏洞。

它怎样工作:先固定提示、分辨率和采样次数,再对每条提示重复生成,然后让自动指标做批量筛查、让人工按维度盲评,最后单独汇总失败类型与安全问题。

避免只挑最好看的样例 同一提示多次采样后挑一张展示,会掩盖单次成功率。评测必须固定采样预算、分辨率、编辑条件和随机种子策略,才能比较版本。

怎样解释与适用边界:某个维度更高,只表示该维度在这组测试条件下更好,不能自动推出整体更好。自动指标难覆盖构图偏好和高风险语义,人工评分也会受文化、任务与顺序影响;安全失败不能被其它维度的高分平均掉。

7它带来的新问题安全

能凭空造出逼真图像,也带来了纯技术之外的麻烦。

生成图像治理,可以理解为贯穿生成前、生成中和发布后的风险控制,用于降低版权侵害、冒充真人、诈骗和虚假传播。它的输入包括用户请求、涉及的人物与素材、授权状态和使用场景;输出包括允许、限制或拒绝决定,以及对生成内容的标记、来源记录和人工复核结果。

  • 版权争议:训练数据里包含大量受版权保护的作品,「学了别人的画风再生成」的边界仍在争论。
  • 深度伪造:能生成以假乱真的人物图像,用于造谣、诈骗、侵权。
  • 检测与水印:由此催生「判断一张图是不是 AI 生成」的技术,和生成能力在军备竞赛(见「AIGC 检测与水印」)。

它怎样工作:生成前先检查身份、授权与用途,生成时限制明显高风险请求,生成后再添加来源信息、保留审计记录并对敏感内容人工复核。水印是在文件或画面中加入来源线索;检测器则根据统计特征估计图片是否由 AI 生成,两者作用不同。

怎样解释与适用边界 水印存在只能说明某套工具留下了来源线索,不能证明画面内容为真;检测器给出的也只是概率判断,压缩、截图或新模型都可能使它失效。法律、授权和可接受用途还会因地区与场景变化,技术检测不能替代治理责任。

8把整条因果链连起来综合

从文本语义、条件注入到图像采样与分项验收,把“看起来不错”拆成可检查机制。

  1. 图像生成是造一张全新的图,不是检索拼贴。(§1)
  2. 它要同时办两件事:读懂文字(图文对齐)+ 把图画出来(生成引擎)。(§2)
  3. 当今引擎主要是扩散:去噪生成,文字作为条件注入。(§3)
  4. 可控生成和图像编辑给了更细的方向盘。(§4)
  5. 软肋:图里写字、手指、一致性、事实性(与幻觉同源)。(§5)
  6. 评估必须拆开好看、贴题、一致性、事实和安全,不能只报一个总分。(§6)
  7. 还带来版权、深伪、检测水印等技术之外的问题。(§7)
过关标准 如果你能分清「图像生成是任务、扩散是引擎」,并说出「为什么‘图里准确写字’比画好一只柯基还难」,你就抓住了它的内核。

9常见误解直觉

误解更准确的理解
AI 画图是从图库拼贴通常是从学到的分布采样图像表示,不是简单检索拼贴;但模型可能记忆并复现训练片段
图像生成 = 扩散模型图像生成是任务,扩散是当今主流引擎(还有 GAN、自回归等)
它生成的图是准确的是「看起来对」,可能与事实不符,与幻觉同源
写好提示就能让图里出现正确文字「图中准确写字」仍是老大难,需专门能力/工具
生成能力只是技术问题还牵涉版权、深伪、检测水印等伦理与法律问题

10检查你是否真的理解自测

  1. AI 图像生成是检索拼贴现成图吗?它到底在做什么?
  2. 「一句话变成一张图」要同时办成哪两件事?各靠什么?
  3. 「图像生成」和「扩散模型」是什么关系?
  4. 想精确控制构图/姿势或只改局部,有哪些手段?
  5. 图像生成现在有哪些稳定的软肋?为什么说「事实性」问题和幻觉同源?
  6. 它带来了哪些技术之外的问题?
参考答案
  1. 不是简单拼贴;它在像素、潜变量或视觉 token 空间采样并解码,但仍需防范训练样本记忆与复现。
  2. 读懂文字(文本理解+图文对齐)和把图画出来(生成引擎);分别靠 CLIP 式对齐和扩散等引擎。
  3. 图像生成是任务,扩散是当今实现它最主流的引擎,此外还有 GAN、自回归等路线。
  4. 可控生成(加线稿/姿势/深度等额外条件、局部重绘)和图像编辑(在已有图上按指令改)。
  5. 图里写字、手指与复杂结构、多图角色一致性、事实性;事实性是因为它生成「看起来对」而非「真的准」,与大模型幻觉同源。
  6. 训练数据版权争议、深度伪造、以及由此催生的 AIGC 检测与水印。

11概念依赖与延伸学习路线

学习层级涉及概念
先修扩散模型、嵌入、CLIP、多模态
本页核心任务 vs 引擎、文本理解+对齐、软肋(写字/一致性/事实性)
紧邻延伸可控生成、图像编辑、超分辨率、生成对抗网络 GAN
更远视频生成、AIGC 检测与水印、幻觉、AI 治理
资料来源与改编说明
访问日期:2026-07-22