- 35 億パラメータモデル:高品質なアニメ画像生成に十分な性能を備えながらも効率的なモデルサイズ
- Next-DiT アーキテクチャ:Lumina アーキテクチャの研究に基づき、新たに設計された NewBie 固有のアーキテクチャを採用
- 二重テキストエンコーダー:メインエンコーダーとして Gemma3-4B-it を使用し、Jina CLIP v2 を補助エンコーダーとして活用することで、プロンプトの理解精度を向上
- FLUX VAE:FLUX.1-dev の 16 チャネル VAE を採用し、より豊かな色表現と精細なテクスチャディテールを実現
- XML 構造化プロンプト:注意機構の正確なバインディングおよび属性の分離(disentanglement)を可能にする XML 形式をサポート
NewBie-image 文生成画像ワークフロー
JSON ワークフローファイルをダウンロード
ComfyUI Cloud で実行
モデルのダウンロードリンク
text_encoders diffusion_models vae モデルの保存場所プロンプト形式
NewBie-image は、キャラクター生成に特化して最適化されたアニメ画像生成モデルです。学習には XML 構造化プロンプトが用いられており、各<> タグはカテゴリ(例:<appearance>、<clothing>)を定義し、</> で閉じられます。タグ内の内容は標準の Danbooru タグです。この構造により、複数キャラクターを含むシーンにおいて、属性の正確なバインディングを実現できます。
完全なプロンプト作成ガイドについては、公式ドキュメントをご参照ください。
NewBie-image-Exp0.1 は以下の 3 種類のプロンプト形式をサポートします:
- 自然言語:標準的なテキストによる記述
- タグ形式:Danbooru スタイルのタグ
- XML 構造化形式:複数キャラクターを含むシーンに推奨