本文へ移動
KUROHA LAB.

Text to Imageの基本ワークフロー|接続を逆から読む

著者 黒羽霞藍 / 公開 2026.09.24

ComfyUIのワークフローは、最終出力から逆にたどると読みやすくなります。ここでは標準的なチェックポイントを使う Text to Image の構成を説明します。モデルによって必要なノードは異なるため、利用するモデルの公式例も確認してください。

完成画像から線を戻る

  1. Save Image に入るIMAGEは、VAE Decode の出力です。
  2. VAE Decodeには、KSampler のLATENTと、Load Checkpoint のVAEを渡します。
  3. KSamplerには、Load CheckpointのMODEL、正・負のCONDITIONING、Empty Latent Image のLATENTを渡します。
  4. 正・負のCONDITIONINGは、それぞれの CLIP Text Encode で作ります。CLIPはLoad CheckpointのCLIP出力から接続します。

最初の実行

モデルの推奨画像サイズを確認し、batch_sizeを1にして実行します。基本のテキストから画像への生成ではKSamplerのdenoiseを1.0に設定します。結果と一緒にモデル名、シード、steps、cfg、samplerの設定を保存すると、次の変更を比べやすくなります。

一つだけ条件を変える

同じシードでプロンプトの一語だけを変え、その前後を比較します。次に画像サイズを変えたい場合は元の条件へ戻してから試します。複数の条件を同時に変えると、違いの原因を特定しにくくなります。

基本の接続例は ComfyUI公式チュートリアルを参照してください。