Claude Code 教學/第 13 篇・共 17 篇
AI 生圖入門(一)打字就能變圖:文生圖與主模型演變
AI 生圖系列第一篇。從最基本的「打字變圖」開始,帶你認識主模型的演變(SD1.5 → SDXL → Flux → Qwen-Image)、GGUF 為什麼能讓大模型在小機器上跑,並在 ComfyUI 裡一步步接出你的第一條文生圖流程。
這是「AI 生圖入門」系列的第一篇。整個系列會由淺入深:這篇先打好地基——文生圖,也就是「打一段字、生一張圖」。你會認識這幾年主模型怎麼演變、GGUF 是什麼,最後在 ComfyUI 裡親手接出第一條生圖流程。
補充:這系列以 ComfyUI 為操作環境。它把每個步驟做成一個「節點」,你用線把節點串起來,像組電路。所以下面很多名詞其實是「節點」——一個負責一件事的小積木。
一、文生圖是什麼
文生圖(text-to-image) 就是字面意思:你打一段文字(叫 prompt,提示詞),AI 生出一張對應的圖。提示詞通常分兩種:
- 正向提示詞(positive):你想要畫面裡有的東西,例如
a cat sitting on a wooden table, soft light。 - 負向提示詞(negative):你不想要出現的東西,例如
blurry, extra fingers, low quality。
AI 生圖的原理是「去噪(denoise)」:一開始是一整片電視雪花般的雜訊,模型看著你的提示詞,一步一步把雜訊擦掉、擦成一張符合描述的圖。理解這個「從雜訊擦成圖」的過程,後面很多參數就好懂了。
二、主模型:一切的畫師本體
要生圖,先得有一個主模型(也叫 checkpoint,大模型本體)。這幾年主模型一路演化,你會聽到的名字大致是這個順序:
- Stable Diffusion 1.5(SD1.5):2022 年的經典款。小、快、外掛最多,老機器也跑得動,但畫質和對提示詞的理解力較弱。
- SDXL:SD 的加大版,畫質明顯提升,相容的外掛也多,是很長一段時間的主力,現在仍是穩定首選。
- Flux:2024 年由 Black Forest Labs 推出,對文字理解、手指、細節都上一個檔次,目前的高品質首選。常見
dev(畫質好)和schnell(速度快)兩個版本。 - Qwen-Image:阿里推出的生圖模型,中文提示詞、以及「把文字寫進畫面裡」(招牌、海報字)特別強。
選哪個?一句話原則:機器普通、想要外掛多 → SDXL;追求最好畫質、機器夠力 → Flux;中文或畫面要有文字 → Qwen-Image。
三、GGUF:讓大模型在小機器上跑得動
Flux 這種新模型動輒十幾 GB,一般顯卡或 Mac 塞不下。GGUF 是一種「壓縮打包格式」,術語叫量化(quantization)——把模型精度稍微降一點,換取檔案變小、記憶體省一半以上,畫質只掉一點點。
比喻:原模型是一張超高解析度地圖,GGUF 版是印成「夠用就好」的解析度,看路綽綽有餘,檔案卻小到能塞進背包。
你會看到 GGUF 檔名帶 Q8、Q6、Q4 這種標記,數字越大=壓越少=畫質越好但越吃記憶體。挑選原則:記憶體夠就選 Q8,不夠往 Q6、Q4 降。Mac 或顯示卡記憶體不大的人,通常就從模型的 GGUF 版下手。
四、動手:在 ComfyUI 接出第一條文生圖流程
ComfyUI 一打開,預設就有一條文生圖流程。我們把它從左到右拆開,你會看到六個關鍵節點,資料像水一樣由左往右流:
Load Checkpoint ──┬─(MODEL)──────────────┐
├─(CLIP)─→ CLIP Text Encode(正向)─┐
├─(CLIP)─→ CLIP Text Encode(負向)─┤
│ ▼
Empty Latent Image ─(LATENT)──────────→ KSampler ──(LATENT)─→ VAE Decode ─→ Save Image
└─(VAE)──────────────────────────────────────────↑
一步步操作:
- Load Checkpoint:載入你的主模型。這個節點會吐出三條線——
MODEL(模型本體)、CLIP(負責讀懂文字)、VAE(負責把內部資料轉成人眼看得到的圖)。 - CLIP Text Encode(正向):把你的正向提示詞打進去,它的
CLIP輸入接上 Checkpoint 的 CLIP。這一步是把文字翻譯成模型看得懂的訊號(叫 conditioning)。 - CLIP Text Encode(負向):同上,打負向提示詞。
- Empty Latent Image:設定畫布的寬、高和一次要生幾張(batch size)。SD1.5 建議 512×512 起跳,SDXL/Flux 用 1024×1024。尺寸不是越大越好,超出模型訓練的解析度反而會畫崩。
- KSampler:整條流程的心臟,把雜訊擦成圖。幾個必調參數:
- seed(種子):隨機碼。固定它=每次生出同一張;換數字=換一張。
- steps(步數):擦幾次雜訊。20~30 常見,太低會糊、太高只是浪費時間。
- cfg:提示詞的「服從度」。太低會亂跑、太高會僵硬失真,SDXL 常用 6~8。
- sampler_name/scheduler:去噪的演算法,新手用預設(如
euler)即可。 - denoise:文生圖固定填 1.0(整張從零畫起)。這個值在下一篇圖生圖會派上大用場。
- VAE Decode:吃 KSampler 產出的結果 + Checkpoint 的 VAE,把內部資料轉成真正的圖。
- Save Image:把圖存到硬碟。
接好後按下生成(Queue Prompt),第一張圖就出來了。想換一張:改 KSampler 的 seed。想換風格:換 Load Checkpoint 的模型。想微調畫面:改提示詞。
Mac 提醒:Apple Silicon 跑得動,但比同級 N 卡慢不少,且部分節點對 CoreML/MPS 相容性有限,遇到某些自訂節點報錯是正常的。先用 SDXL 或 Flux 的 GGUF 版,體感會順很多。
小結與下一篇
你現在手上有一條能動的文生圖流程了。這篇的重點:主模型是畫師本體(挑 SD1.5/SDXL/Flux/Qwen),GGUF 是它的省記憶體版,KSampler 是把雜訊擦成圖的心臟。
但現在風格和構圖都還是 AI 隨機決定。下一篇〈幫 AI 加料:LoRA 與 ControlNet〉,我們就來學怎麼「指定畫風」和「指定構圖」,還會教你自己訓練一個 LoRA。
本文為入門導覽,模型與工具更新很快,實際操作以你安裝的版本為準。