本文へスキップ

モデル別の作法(Illustrious / NoobAI / Pony)

同じDanbooruタグが3系統で別物になる理由と、品質タグ・アーティストタグ・推奨設定・ネガティブの違いを比較表で整理する。

Illustrious XL / NoobAI-XL / Pony Diffusion V6 XL は「Danbooruタグで動くSDXL系アニメモデル」と一括りにされがちだが、語彙も文法も推奨設定も別物である。片方で完璧に動くプロンプトを他方へ貼ると、無意味なトークンで75トークン枠を潰したり、必須のトリガーが欠けたりする。

30秒で押さえる対応表

項目Illustrious XLNoobAI-XLPony Diffusion V6 XL
ベースSDXL(v0.1 は Kohaku-XL beta5 から継続学習)Illustrious v0.1 の追加学習SDXL
学習データDanbooru2023(v0.1: 7.5M → v2.0: 20M)Danbooru 全量(〜2024-10-23)+ e621独自2.6M(anime/cartoon/furry/pony ≒ 1:1)
品質タグmasterpiece / best quality / good quality / average quality / bad quality / worst qualitymasterpiece / best quality / good quality / normal quality / worst qualityscore_9, score_8_up, score_7_up, score_6_up, score_5_up, score_4_up
年代タグoldest / old / modern / recent / newestold / early / mid / recent / newestyear 2021 形式なし
レーティングgeneral / sensitive / questionable / explicitgeneral / sensitive / nsfw / explicit(モデルカードのprefixは saferating_safe / rating_questionable / rating_explicit(e621式3値)
アーティストタグ素のタグ名(wlopartist: プレフィックス付き除去済み。原則効かない
公式CFG5〜7.5(v0.1)eps 5〜6 / v-pred 4〜5記載なし(公式サンプル実測 8.5)
公式Steps20〜28eps 25〜30 / v-pred 28〜3525(公式サンプル実測 30)
CLIP skip記載なし設定不要2 必須
公式ネガティブ作例に長い列あり明示的に1本指定あり原則不要(空)

挙動が変わる4つの理由

  • アーティストタグの生死 — Illustrious は技術レポートで作家名を難読化しない方針を明言し、学習中に作家名・キャラ名をドロップさせない仕組みまで入れている。NoobAI もキャプション順序に <artists> 枠を持つ。Pony は公式カードに “Artists’ names have been removed” とある。
  • 品質語彙が交換不能 — Pony 公式は masterpiece 等の品質修飾を「不要」と明記。逆に score_9, ... を Illustrious / NoobAI に入れても学習語彙になく、トークン枠を浪費するだけ。
  • 学習分布の濃度差 — Pony のアニメ画像は全体の約1/4(約65万枚相当)で、Danbooru全量を学習した2者よりマイナータグのサンプル数が桁で少ない。
  • e621語彙との衝突 — Pony は anthro / feral を含む e621 語義が第一言語で、曖昧なタグが anthro 寄りに引っ張られる。NoobAI も e621 を学習しており、公式ネガティブで mammal, anthro, furry, ambiguous form, feral, semi-anthro を明示的に打ち消している。Pony にこの指示は公式にない。

LoRA・ControlNet・Embedding はファミリー間で互換性がない。NoobAI は Illustrious 派生なので両者間は比較的互換だが、Pony V7 は AuraFlow ベースで SDXL 資産を流用できない。

Illustrious XL

品質語彙は6段で、技術レポートは各段に対応するスコア基準の割合を示す(worst quality ≒ 8%、average quality ≒ 60%、best quality ≒ 92%、masterpiece ≒ 100%)。NoobAI のような明示的なパーセンタイル定義ではない点に注意。年代タグは NoobAI と名前が衝突しつつ意味が違うので最も事故りやすい。

タグIllustriousNoobAI
oldest〜2017年なし
old〜2019年2005〜2010年
earlyなし2011〜2014年
midなし2014〜2017年
modern〜2020年なし
recent〜2022年2018〜2020年
newest〜2023年2021〜2024年

very aesthetic / extremely aesthetic は広く使われるが、Onoma の一次資料に語彙定義はなく、技術レポートは審美修飾子の詳細を「今後のリリースで公開する」と述べたきりで一次情報での確認は取れていない

学習時のタグ順スキーマは person count ||| character names ||| rating ||| general tags ||| artist ||| score range based rating ||| year modifier品質タグと年代タグは末尾、レーティングは前寄りが学習形だが、v1.0 以降はタグ順シャッフルが導入され、推論時のタグ順の影響について公式の定量的言明はない。

設定は v0.1 が Euler a / 20〜28 steps / CFG 5〜7.5 / 1MP。v1.0 以降は公式の推奨設定セクション自体が存在しない。解像度はネイティブ 1MP〜2.25MP、v2.0 は 512〜1536で縦横32の倍数。ネガティブは v0.1 作例が最長。

worst quality, comic, multiple views, bad quality, low quality, lowres, displeasing, very displeasing, bad anatomy, bad hands, scan artifacts, monochrome, greyscale, signature, twitter username, jpeg artifacts, 2koma, 4koma, guro, extra digits, fewer digits

一方 v2.0 の Civitai 作例は worst quality, bad quality の2語だけで、公式内でも大きく振れている。v3.0-epsilon / v3.5-vpred では control tokens(low contrastvery high contrastdarkvery brightmuted colorsvery vibrant colors など6軸4段)が公開されたが、v3系は重み未公開で、オープンウェイトは v0.1 / v1.0 / v1.1 / v2.0 の4つのみ。

NoobAI-XL

モデルカードが逐語で示すプレフィックスとネガティブ。

masterpiece, best quality, newest, absurdres, highres, safe,
nsfw, worst quality, old, early, low quality, lowres, signature, username, logo, bad hands, mutated hands, mammal, anthro, furry, ambiguous form, feral, semi-anthro

品質タグはDanbooruの人気度パーセンタイル基準(masterpiece >95%、best quality 85〜95%、good quality 60〜85%、normal quality 30〜60%、worst quality ≦30%)。審美タグ(very awa など)は v-pred 系モデルカードにのみ存在し、公式表は2語を挙げた後 ... で打ち切られている。流通している very as2一次資料では確認できない

artist: プレフィックスを付けるのが公式ガイドブックの指示で、Diffusers サンプルも artist:john_kafka, artist:nixeu, artist:quasarcake。これが Illustrious との最大の非互換点。公式トリガー辞書 Laxhar/noob-wikiメタタグ汚染を含み、danbooru_artist.csv の最頻エントリは banned_artist(82,834件)、e621側の上位は conditional_dnp / avoid_posting と実在作家名ではない。キャラの再現度が足りないときは core_tags 列(例: hatsune_miku1girl, aqua eyes, blue eyes, very long hair, aqua hair, long hair, twintails, detached sleeves)を併記するのが公式の指示で、重みを上げる対処ではない。

eps(0.5〜1.1)v-pred 1.0
CFG5〜64〜5(ガイドブックは 3.5〜5.5)
Steps25〜3028〜35
サンプラーEuler aEuler(「他のサンプラーは正しく動作しない」)
Karras系不可
追加設定なしDynamic CFG / CFG Rescale を 0.2 推奨
実行環境素の A1111 で動くreForge / A1111 dev / ComfyUI が必要

解像度は共通で総面積1024×1024相当のバケット(768x1344832x1216(推奨)896x11521024x10241152x8961216x8321344x768)。512×512未満は破綻する。Diffusers で v-pred を使うなら prediction_type: "v_prediction"rescale_betas_zero_snr: True の両方が必須で、これが立っていない環境では色が壊れる。

公式資料同士の矛盾も押さえておきたい。モデルカードは品質タグを「Prompt Prefix(先頭)」とするが、同じ Laxhar の公式ガイドブックは「タグの末尾に付けると品質が大きく改善する」と書く。ガイドブックが「アンダースコアを除去せよ」と指示する一方、公式 Diffusers サンプルは artist:john_kafka とアンダースコアを残し、noob-wikitrigger 列は john kafka(スペース区切り・prefixなし)。artist: プレフィックスも同様で、ガイドブックと Diffusers サンプルは付ける側だが、Laxhar Lab 配布の公式ユーザーマニュアルは artist:wlop を「表面的に prefix を足しただけ」の誤用として挙げ、素の wlop を正としている。どれが正か決着していない。

Pony Diffusion V6 XL

公式テンプレートは score_9, score_8_up, score_7_up, score_6_up, score_5_up, score_4_up, just describe what you want, tag1, tag2。意味論的には score_4_up はデータセット全体を指すため品質フィルタとして無意味だが、それでも効く。公式解説記事が自ら “a variation of The Clever Hans effect” と認める通り、モデルが各タグを個別概念ではなく長い文字列全体を1つの塊として「良い画像」に紐づけて学習してしまったからである。

  • 公式見解は「score_9 単体でも使えるが、フル文字列に比べて効果は明確に弱い」。普及した3連短縮形 score_9, score_8_up, score_7_up公式が推奨・検証した記録は見つからない
  • ネガティブ側では弱い。公式は「下は4までしか行けない」ため本当に悪い画像から遠ざける効果はないと述べる。
  • スタイル/アーティストLoRA使用時は score タグを外した方が良い場合があると公式に明記。SD1.5版の V6-1.5 は例外で「短縮形単体でも良く反応する」。

source_pony / source_furry / source_cartoon / source_anime は品質タグではなく “data selection tags”、260万枚のうち該当する約1/4のサブセットへ寄せるスイッチ。アニメ調狙いで source_furry, source_pony, source_cartoon をネガへ入れる運用は広いが公式記述ではない。レーティングは e621 式3値で、Danbooru由来の rating:generalrating:sensitive という書き方は学習語彙に存在しない。

作家名は「削除」ではなく短いランダム風トークンへの置換だったことがコミュニティのリバースエンジニアリングで報告されている(fqx / mjm / zix など)。ただし当該記事は deprecated 扱いで著者自身が誤りの可能性を明記しており、個別トークンの対応関係は一次情報での確認は取れていない。実用上は e621 の作家1436名を学習した外部LoRA(by <artist> 構文)が事実上の標準。

設定面では CLIP skip 2 が必須で、公式は「守らないと低品質のblobになる」と警告。公式テキストは Euler a / 25 steps / 1024px だが、公式サンプル画像の実測は一貫して CFG 8.5 / 30 steps / 1152×896 / ネガティブ空文字。定番とされる「CFG 7、DPM++ 2M Karras」は非公式。ネガティブの公式の立場は「ほとんどの場合で不要」で、Pony系主要マージの作者も「長大なネガティブやネガティブ埋め込みはむしろ悪化させる」と述べている。

2025-10-08 公開の V7 base は AuraFlow 7B ベースで SDXL ではなく、768〜1536px / 最低30 steps、CLIP skip も適用されない。公式カードに**「特殊タグ(品質タグを含む)は V6 と比べてはるかに効きが弱い」**とあり、V7 で score タグを盲目的に付けるのは非推奨。

系統をまたぐときのチェックリスト

移植方向やること
Illustrious → NoobAIアーティストタグに artist: を付ける(公式資料間で見解が割れるので素のタグ名も試す)。年代タグの意味が変わるので old / recent を書き直す。average quality / bad qualitynormal quality / worst quality
NoobAI → Illustriousartist: を外す。ネガティブから mammal, anthro, furry, ambiguous form, feral, semi-anthro を削る。年代タグを再解釈
Illustrious/NoobAI → Pony品質タグを score 連鎖に置換。アーティストタグは削除(外部LoRAへ)。rating を rating_* 形式へ。CLIP skip を2に。ネガティブは一度空にする
Pony → Illustrious/NoobAIscore_* / source_* / rating_* を全削除。品質タグと rating を各系統の語彙へ。CLIP skip を戻す。CFG を 8.5 帯から下げる(Illustrious 5〜7.5 / NoobAI eps 5〜6・v-pred 4〜5)

共通の落とし穴として、Danbooru からコピーしたアンダースコア付きタグlong_hair)は CLIP のトークン列が変わって別条件になるためスペースに直す。括弧を含むタグは A1111 / ComfyUI とも \( \) にエスケープする。