本文へスキップ

実用レシピ集

ポートレートから複数キャラ・和風・SFまで10本の完成プロンプトを、狙い・ネガティブ・推奨設定・タグ選定の根拠つきで並べた実践集。

ここまでの各ページで扱ったルールを、そのまま貼って動く形にまとめた。各レシピは「狙い / 完成プロンプト / ネガティブ / 推奨設定 / なぜこのタグ構成か」の5点セットで構成する。

読む前の共通ルール

表記 — タグはすべてアンダースコアをスペースに直し、括弧は \( \) にエスケープしてある。Laxhar Lab(NoobAI開発元)の公式ガイドブックが「Danbooruやe621のタグはアンダースコアを外し、括弧の前後にバックスラッシュを付ける」と明記している。hatsune_mikuhatsune miku はCLIPのトークン列が別物になるため、これは表記揺れではなく別の条件付けになる。

品質タグの位置 — NoobAI公式モデルカードは masterpiece, best quality, newest, absurdres, highres, safe,先頭のプレフィックスとして提示するが、同じLaxhar Labの公式ガイドブックは「TAGの末尾に付けると品質が大きく改善する」と書く。同一組織の一次資料2件が食い違っており統一見解はない。以下は先頭に置く形で統一するが、末尾でも動く。一方Illustriousは技術レポートが学習スキーマを person count ||| character names ||| rating ||| general tags ||| artist ||| score range based rating ||| year modifier と明記しており、品質・年代が末尾。Illustrious用レシピはその順に並べてある。

年代タグは互換性がないnewest はIllustriousで約2023年、NoobAIで2021〜2024年。old はIllustrious約2019年、NoobAI 2005〜2010年と全く別物。モデルを乗り換えるときは必ず書き換える。

NoobAIのrating語は safegeneral で公式資料が割れている — モデルカードのプレフィックスは safe、Laxhar公式ユーザーマニュアルは「general / sensitive / nsfw / explicit の4種」と書く。どちらが実トークンかは一次資料からは確定できない。以下では両方の書き方を混在させてあるので、効かなければもう一方を試すこと。


レシピ1: 寄りのポートレート(NoobAI-XL eps 1.1)

狙い — 顔の描き込みを最大化した胸から上のバストアップ。既存キャラを高い再現度で出す。

完成プロンプト

masterpiece, best quality, newest, absurdres, highres, safe,
1girl, solo, hatsune miku, vocaloid,
aqua eyes, very long hair, aqua hair, twintails, detached sleeves,
upper body, looking at viewer, closed mouth, light smile,
white shirt, black necktie, indoors, window, depth of field, blurry background

ネガティブ

nsfw, worst quality, old, early, low quality, lowres, signature, username, logo,
bad hands, mutated hands, mammal, anthro, furry, ambiguous form, feral, semi-anthro

推奨設定 — Euler a / Steps 28 / CFG 5.5 / 832×1216 / CLIP skipは設定不要(ガイドブックが “No need to set the CLIP skip layer” と明記)/ VAEはSDXL標準。

なぜこのタグ構成か

  • キャラ名+シリーズ名をセットで書くのがNoobAIマニュアルの指示。character: プレフィックスを付けるのは誤りと明記されている。
  • 続く aqua eyes, very long hair, aqua hair, twintails, detached sleeves は、Laxhar公式データセット noob-wikidanbooru_character_webui.csvhatsune_miku に対して持つ core_tags 列からの抜粋(列の全文は 1girl, aqua eyes, blue eyes, very long hair, aqua hair, long hair, twintails, detached sleeves1girl と、aqua eyes/very long hair に含意される blue eyes/long hair は重複するので落とした)。マニュアルは「再現度が足りないときは core_tags を数個足せ」と指示している。重みを上げるのではなくcore_tagsを足すのが公式の正しい対処。
  • white shirt はDanbooru実測1,393,129件の複合タグ。white, shirt と分けると色移りの原因になる。
  • ネガティブはNoobAI全バージョン共通の公式文字列そのまま。ただし mutated hands はDanbooruにタグレコード自体が存在せず、username も実測94件しかない。マニュアル自身が mutated hands のSource欄を - と自認しており、この2語はタグ学習ではなくCLIPの一般英語理解に依存しているにすぎない。

レシピ2: 全身立ち絵(Illustrious XL v2.0)

狙い — 白背景・ポーズ固定の資料用立ち絵。衣装の全体像を破綻なく見せる。

完成プロンプト

1girl, solo, general,
long hair, brown hair, blue eyes, serafuku, sailor collar, red neckerchief,
pleated skirt, black thighhighs, loafers,
full body, standing, arms at sides, looking at viewer, straight-on,
simple background, white background,
masterpiece, best quality, very aesthetic, newest

ネガティブ

worst quality, comic, multiple views, bad quality, low quality, lowres,
displeasing, very displeasing, bad anatomy, bad hands, scan artifacts,
monochrome, greyscale, signature, twitter username, jpeg artifacts,
2koma, 4koma, extra digits, fewer digits

推奨設定 — Euler a / Schedule: Automatic / Steps 28 / CFG 7.5 / 832×1216 または 1024×1024。v2.0は512〜1536px、幅・高さともに32の倍数、最大1:10のアスペクト比まで対応と公式が明記している。

なぜこのタグ構成か

  • 並びは論文のスキーマ通り、人数 → キャラ名 → rating → 一般タグ → アーティスト → 品質 → 年代の順(このレシピはキャラ名とアーティストを使わないのでその枠が空いている)。
  • full body(実測1,264,761件)は「全身が写り、かつフレームの大半を占める」の意。足まで入れたいのに cowboy shot(841,617件、腿から上)を書くと必ず切れる。
  • simple background, white background は2つセットで書く。前者だけだと単色でない簡素な背景も含む。
  • ネガティブはIllustrious v0.1公式モデルカードの作例から guro を除いたもの。multiple views 2koma 4koma comic はDanbooruに大量にある「1枚に複数カットが並んだ画像」を弾く指定で、立ち絵では特に効く。
  • very aesthetic はIllustrious系で広く使われるが、Onomaの一次資料に語彙定義はない。技術レポートは審美修飾子の詳細を「将来のリリースで公開する」と述べたきり公開しておらず、公式ブログの作例に extremely aesthetic が含まれるのみ。効かなければ外してよい。

レシピ3: 背景重視の情景カット(Illustrious XL v2.0)

狙い — 人物を小さく置き、風景と光でもたせる。人物のディテールを競わせない。

完成プロンプト

1girl, solo, general,
wide shot, from above, scenery, cityscape, rooftop, chain-link fence,
sunset, orange sky, cloud, backlighting, lens flare, wind, floating hair,
school uniform, standing, from behind, looking back,
masterpiece, best quality, newest

ネガティブ

worst quality, low quality, lowres, low details, bad quality, poorly drawn,
bad anatomy, multiple views, bad hands, blurry, artist sign, close-up, portrait

推奨設定 — Euler a / Steps 28 / CFG 7.0 / 1536×864 などの横長。Illustrious v1.0以降はネイティブで1MP〜2.25MPに対応する。

なぜこのタグ構成か

  • wide shot は「全身が写るが画面の25%以下」というDanbooru定義で、実測23,540件と少数派。効きが弱いので from abovescenery を併記して引き寄せる。
  • ネガティブに close-upportrait を入れているのがこのレシピの要。寄りの構図タグは学習枚数が桁違いに多く(portrait 140,803件 対 wide shot 23,540件)、放っておくとモデルが寄ってくる。ECCV 2024の研究はネガティブが「最初から出さない」のではなく「出たものを打ち消す」形で働くと報告しており、出やすいものを押し戻すこの用途はネガティブ本来の使い方に合う。
  • ネガティブ本体はIllustrious v2.0公式ブログの作例メタデータがベース。v3.6の公式注記が「他モデル向けのネガティブはIllustriousでは効かない場合がある」と警告している通り、汎用ネガティブ埋め込みの流用は避ける。ただし公式作例に含まれる low details artist sign はDanbooruにタグレコードが存在せず、poorly drawn は post_count 0 の非推奨タグ。この3語はタグ学習ではなくCLIPの一般英語理解に頼っているだけなので、外しても構わない。

レシピ4: 複数キャラ(NoobAI-XL eps + Forge Couple / Regional Prompter)

狙い — 2人の髪色・服の色を混ぜずに描き分ける。

完成プロンプト(領域分割あり・A1111 / Forge)

masterpiece, best quality, newest, absurdres, highres, safe,
2girls, indoors, classroom, day, window, looking at viewer
BREAK
1girl, blonde hair, twintails, blue dress, blue eyes, smile, standing
BREAK
1girl, red hair, ponytail, red dress, green eyes, closed mouth, standing

ネガティブ — レシピ1と同じNoobAI公式文字列に solo を追加。

推奨設定 — Euler a / Steps 30 / CFG 5.5 / 1216×832(横長にして左右に分ける)。Forge Coupleは Advanced モードで領域を0.0〜1.0の正規化座標指定、Regional Prompterなら Attention モード+横分割。区切り記号は拡張ごとに違う:Regional Prompterは上記の BREAK、Forge Coupleは既定が改行(1行=1領域)なので BREAK は書かずに行で分ける。

なぜこのタグ構成か

  • solo2girls は同時に書いてはいけない。Danbooru実測で両方付いた画像は504件、2girls 全体の0.035%しかなく事実上排他である。ネガティブ側に solo を入れるのは有効。
  • 色は必ず複合タグで持つ。blue dress(185,426件)red dress(142,910件)は単一タグとして学習されている。blue, dress と割ると学習分布の外に出る。
  • なぜ領域分割が必要か — Illustrious技術レポートは「Danbooruはタグベースのメタデータに依存しており、複数キャラの構図や位置の制御が難しい」と明言している。タグは画像単位でフラットで、「どの属性がどのキャラに属するか」という情報が学習データに一切存在しない。プロンプトの書き方だけでは原理的に解決しない。
  • BREAKの限界 — BREAKは現在のチャンクを75トークンまでパディングして次を開始する機能で、CLIP内部のself-attentionによる混線は確実に切る。ただしU-Net側のcross-attentionは連結後の全トークンを見るため空間的分離は保証されない。さらにSDXLではpooled text embeddingが第1チャンクからしか取られない実装なので、早い位置でBREAKすると以降のタグはpooled条件に一切寄与しない。
  • ComfyUIでは BREAK は動かない。CLIPトークナイザが小文字化して break という普通の英単語1トークンとして絵に影響する。CLIPTextEncodeを複数用意して Conditioning (Concat) で繋ぐか、Attention Coupleを使う。そのAttention Couple公式ドキュメント自身も「マスク領域への効果の限定は保証されない」と明記している。

レシピ5: アクションカット(Illustrious XL v2.0)

狙い — 動きと勢い。静止ポーズにさせない。

完成プロンプト

1girl, solo, sensitive,
katana, holding sword, slashing, motion blur, motion lines, speed lines,
dutch angle, foreshortening, from below, dynamic pose, midair, jumping,
black hair, long hair, hair between eyes, floating hair,
black jacket, pleated skirt, night, city lights, rain, wet,
masterpiece, best quality, newest

ネガティブ

worst quality, low quality, lowres, bad quality, bad anatomy, bad hands,
bad proportions, extra arms, extra legs, extra digits, fewer digits,
standing, simple background, multiple views

推奨設定 — Euler a / Steps 28 / CFG 6.5 / 832×1216。CFGを7.5から少し落としてあるのは、動きの強いプロンプトでは輪郭が焼きやすいため。

なぜこのタグ構成か

  • foreshortening(68,901件)は短縮法。手前の腕や武器が誇張されて大きく写る効果があり、アクションでは dutch angle(161,816件)との併用が定番。
  • 「空中に浮かせる」タグはDanbooruでは midair(11,250件)で、ハイフン入りの mid-air は post_count 0 の空タグ。同様に「静止させない」つもりでネガティブに static と書くのは誤りで、Danbooruの static は「テレビの砂嵐ノイズ」を指す別概念(1,202件)。ここでは代わりに standing を置いてある。
  • ネガティブの bad proportions(2,390件)extra arms(15,659件)extra legs(945件)はDanbooruに実在するタグで学習信号がある。一方よく見かける poorly drawn hands distorted anatomy はタグレコード自体が存在せず、bad hand(単数形)は post_count 0。この種のプラセボタグはトークンを消費するだけになる。
  • sensitive を明示している理由は露出制御ではない。Danbooru実測で sensitive は全体の43.4%を占める最大クラスで、ratingを書かないと分布が暗黙にsensitive寄りになる。構図タグ側にも偏りがあり、pov は explicit 率63.9%(全体基準10.1%の6.3倍)、lying は31.6%。rating タグは「構図分布をどの帯に固定するか」のスイッチとして機能する(この因果の効果量を測った公開実験はなく、学習データ分布からの推論である点は留保しておきたい)。

レシピ6: 和風・神社(NoobAI-XL V-Pred 1.0)

狙い — 着物と朱色の鳥居。彩度の高い和色を破綻させずに出す。

完成プロンプト

masterpiece, best quality, newest, absurdres, highres, general,
1girl, solo, miko, red hakama, white kimono, wide sleeves,
long hair, black hair, hair ribbon, red ribbon,
shrine, torii, stone lantern, cherry blossoms, falling petals, outdoors, day,
cowboy shot, standing, looking at viewer, closed mouth, holding broom

ネガティブ — レシピ1と同じNoobAI公式文字列。

推奨設定(v-pred専用・ここが最重要)

項目根拠
サンプラーEuler(Euler a ではないモデルカードに「⚠️ Other samplers will not work properly」
Karras系スケジューラ使用不可「V prediction does not support the Karras series of sampling」
Steps28〜35モデルカード
CFG4〜5モデルカード
CFG Rescale0.2Civitaiバージョンノート「configuration of 0.2 for the best results」
解像度832×1216epsと同一バケット
実行環境reForge / A1111 dev / ComfyUI素のA1111では追加プラグインが必要

Diffusersで動かす場合は {"prediction_type": "v_prediction", "rescale_betas_zero_snr": True} を EulerDiscreteScheduler に渡すのが公式コード。この2つが立っていない環境では色が破綻する。なおCFG Rescaleの推奨値はCivitaiバージョンノートが0.2、Laxhar公式ユーザーマニュアルが約0.7と食い違っており、一次資料間で数値が一致していない。

なぜこのタグ構成か

  • red hakama, white kimono red ribbon(264,239件)と、色は全部複合タグ側に寄せてある。朱色と白の面積が大きい構図は色移りが最も出やすく、複合タグ化がコストゼロで最も確実な対策になる。
  • v-pred 1.0の公式バージョンノートは「品質語の効果がこのバージョンでより顕著になった」と述べており、品質タグを省く理由がない。
  • cowboy shot(841,617件)は腿から上+顔で、袴の柄と上半身を同時に見せるのに向く。

レシピ7: SF・メカ(Illustrious XL v2.0 / v3系)

狙い — 硬質な機械ディテールとネオンの発光。人物とメカの両立。

完成プロンプト

1girl, solo, general,
mecha, robot, science fiction, cockpit, hangar, cable, glowing,
neon lights, backlighting, reflection, mechanical arms,
short hair, white hair, red eyes, bodysuit, spacesuit, headgear,
upper body, from side, looking to the side, serious,
very sharp, high contrast, high colorfulness,
masterpiece, best quality, newest

ネガティブ

worst quality, low quality, lowres, bad quality, bad anatomy, bad hands,
blurry, jpeg artifacts, monochrome, greyscale, simple background,
extra digits, fewer digits, multiple views

推奨設定 — Euler / Normal / Steps 28 / CFG 7.5 / 1248×1824 または横長1824×1248。

なぜこのタグ構成か

  • very sharp high contrast high colorfulness はIllustrious v3.x で追加されたcontrol tokens。公式ブログが定義する6系統(Contrast / Brightness / Sharpness / Dynamic Colors / Colorfulness / Saturation)のうち3つを使っている。v3.0-epsilon と v3.5-vpred で機能し、v3.0-vpred では効きが悪いと公式が明記。v2.0以前では未定義の語彙なので、使っても効かない(害はないがトークンは消費する)。
  • 暗い画にしたいとき dark を使いたくなるが、同じ公式ブログが「dark は汚染されている(contaminated)ので用途によっては black theme の方が良い」と注記している。
  • ネガティブに monochrome, greyscale を入れているのは、メカ系のタグが白黒の設定画・線画データを引きやすいため。
  • Illustrious v0.1のモデルカードは「close-up upside-down cowboy shot のような構図決定タグを多用しすぎないこと。競合して混乱を招く」と警告している。構図タグは1系統1つに絞るのが基本。
  • 視線は looking away ではなく looking to the side(277,820件)を使う。looking away はDanbooruの非推奨タグis_deprecated: true、34,942件)で新規投稿には付かず、post_countは減る一方。同様に pilot suit(931件)も非推奨なので、実在タグの spacesuit(7,442件)に置き換えてある。

レシピ8: 日常シーン・室内(NoobAI-XL eps 1.1)

狙い — 生活感のある室内カット。光と小物で情報量を稼ぐ。

完成プロンプト

masterpiece, best quality, newest, absurdres, highres, general,
1girl, solo, cafe, indoors, sitting, table, chair, window,
coffee, cup, holding cup, book, plant,
sunlight, day, light rays, depth of field, blurry background,
brown hair, medium hair, brown eyes, white shirt, cardigan,
upper body, looking at viewer, smile, closed mouth

ネガティブ — レシピ1と同じNoobAI公式文字列。

推奨設定 — Euler a / Steps 28 / CFG 5.0 / 1216×832。日常系は輪郭を立てないほうが雰囲気が出るのでCFGは下限寄り。

なぜこのタグ構成か

  • 環境タグ(cafe, indoors, table, chair, window)→ 小物(coffee, cup, book, plant)→ 光(sunlight, day, light rays)→ 人物特徴、の順に層を分けてある。「午後の暖かい光」を狙って afternoon warm lighting と書きたくなるが、どちらもDanbooru上は post_count 0 の空タグで学習信号がない。実在するのは sunlight(101,755件)light rays(33,041件)day(453,012件)のほう。NoobAIマニュアルは「主要なものから副次的なものへ、論理的な順序で書くほうがよい」と推奨しつつ「誤用の影響はしばしば明らかではなく、場合によっては改善することさえある」とも書いており、マニュアル自身が効果を絶対視していない。
  • holding cup のように「動作+対象」が1つの複合タグとして存在するならそれを使う。holdingcup を離すと結びつかない。
  • sensitive ではなく general を明示している。Danbooru公式のrating定義では水着・下着・パンチラ・透け服は general ではなく sensitive に分類される。SFWの日常カットを狙うならratingを書いて分布を固定するのが確実。副作用として、explicit帯に偏在する構図(POV・寝そべり・極端なローアングル)が出にくくなる=構図の自由度は下がる。

レシピ9: Pony Diffusion V6 XL(アニメ調・ファンタジー)

狙い — Pony系の作法で1枚。他2ファミリとの非互換を体感する。

完成プロンプト

score_9, score_8_up, score_7_up, score_6_up, score_5_up, score_4_up,
source_anime, rating_safe,
1girl, solo, elf, pointy ears, long silver hair, green eyes,
wearing green cloak and leather armor, holding a wooden bow,
standing in an ancient forest, sunbeams through leaves, moss, fog,
cowboy shot, looking at viewer, dramatic lighting

ネガティブ公式のベースラインは「空」が正解。V6モデルページは「ほとんどの場合ネガティブを必要としないよう設計されている」と明記し、公式サンプル画像のメタデータもネガティブが全件空文字列。どうしても入れるなら最小限に留める。Pony系で最も影響力のあるマージ AutismMix SDXL の作者も「SDXL/Pony向けに作られたネガティブ埋め込みや長大なネガティブは結果を悪化させる」と述べている(コミュニティ一次情報)。

推奨設定

項目
CLIP skip2(必須)。公式が「守らないと低品質のblobになる」と警告
サンプラーEuler a
Steps25(公式テキスト)/ 30(公式サンプル実測)
CFG公式記載なし。公式サンプル実測は8.5
解像度1024px基準。公式サンプルは1152×896

なぜこのタグ構成か

  • score連鎖は丸暗記された1つの文字列。作者本人が「a variation of The Clever Hans effect」と表現しており、モデルは各タグを個別概念としてではなく長い文字列全体を「良い画像」と紐づけて学習してしまった。公式見解は「score_9 単体でも使えるが、フル文字列に比べて効果は明確に弱い」。コミュニティで普及している3連(score_9, score_8_up, score_7_up)はPurpleSmartAI公式が推奨・検証した記録を確認できない。なおスタイル/アーティストLoRAを併用するときは、score系にバイアスがあるため外して反応を見るよう公式記事が勧めている。
  • rating_safe はe621/Derpibooru方式の3値(safe / questionable / explicit)。Danbooru式の rating:generalsensitive はPonyの学習語彙に存在しない。逆に masterpiece best quality はPonyでは公式に「不要」と明言されている。
  • アーティストタグは効かない。公式カードが「Artists’ names have been removed」と明記。画風はLoRAか source_* で寄せるしかない。
  • 自然文が混じっているのは意図的。V6は約50%が自然言語キャプションで学習されており、公式に「タグと自然文の両方を理解できる」とされている。逆にIllustrious v0.1へ自然文だけのプロンプトを持ち込むと弱くなる。
  • score連鎖をIllustrious / NoobAIに貼ってはいけない。あちらでは意味のないトークン列として構図とトークン枠を汚すだけになる。

レシピ10: モノクロ線画・ラフ画風(Illustrious XL)

狙い — 塗らない。線と陰影だけで見せる。

完成プロンプト

1girl, solo, general,
monochrome, greyscale, sketch, lineart, graphite \(medium\), traditional media,
simple background, white background, upper body, looking at viewer,
long hair, hair over one eye, jacket, hood down,
masterpiece, best quality, newest

ネガティブ

worst quality, low quality, lowres, bad quality, bad anatomy, bad hands,
jpeg artifacts, scan artifacts, watercolor \(medium\),
extra digits, fewer digits, signature, twitter username

推奨設定 — Euler a / Steps 24 / CFG 6.0 / 832×1216。線画は高CFGで線が潰れやすいので下げ気味。

なぜこのタグ構成か

  • graphite \(medium\) watercolor \(medium\) のような画材タグは括弧を含むので必ずエスケープする。しないとA1111・ComfyUIとも ( を強調記号として解釈する。NoobAIマニュアルは、ganyu ( genshin impact ) と書くと「genshin impact が重み付けされ括弧が消える」誤解釈になると例示している。A1111ではバックスラッシュが除去されるのでトークンコストは0だが、ComfyUIで \[ と書くとバックスラッシュ(token id 59)が残って1トークン無駄になる。[ ] はComfyUIでは特殊文字ではないので素で書く。
  • monochromegreyscale は別概念(前者は単色、後者は無彩色階調)だが、実運用では併記して確実に色を抜く。
  • scan artifacts(4,015件)はスキャン由来のノイズを表すDanbooruタグ。traditional media を正で使うとスキャン画像の分布に寄るため、ネガティブ側で打ち消しておく。

全レシピ共通のチェック項目

#確認判定基準
1アンダースコアが残っていないか_ は1個につきCLIPトークンを1消費し(token id 318)、埋め込み自体が変わる
2括弧がエスケープされているか未エスケープの ( は強調記号として解釈される
3色と名詞を分けていないかblue dress のような複合タグがDanbooruに実在するなら必ずそちらを使う
4solo と人数タグが衝突していないかsolo + 2girls は実測 overlap 0.035%、事実上のエラー
5構図タグを重ねすぎていないかfrom abovefrom below は overlap 0.64%、full bodyportrait は0.82%で真に排他
6品質語彙をモデル間で混ぜていないかnormal quality はNoobAIのみ、average quality bad quality はIllustriousのみ、score_* はPonyのみ
775トークンを超えていないか1でも超えると150トークン枠になり後半が大量のパディングで埋まる。「タグを1個足しただけで絵が変わった」現象の正体
8重みを盛りすぎていないかSDXLではA1111のEmphasis設定を “No norm” にするのが一次資料寄り(実装の説明文が “seems to work better for SDXL” と明記)。同じ (tag:1.4) でもA1111とComfyUIで計算式が違うため、数値をそのまま移植するのは誤り

上の各レシピは出発点であり、チェックポイントを解いた状態のテンプレートとして使ってほしい。差し替えるときは、色は複合タグごと、構図は3系統(フレーミング / カメラ角度 / 被写体の向き)から1つずつ、品質と年代はモデルファミリの語彙に合わせる——この3点を守れば大きく外さない。