「Midjourneyって日本語でも動くらしいけど、実際どうなの?」——非デザイナーの僕が画像生成AIを触り始めて、最初にぶつかった疑問がこれでした。公式ドキュメントを読むと「日本語も一応入力できます」とは書いてあるものの、実際に生成した画像を見て「あれ、思ってたのと違う…」となった経験がある人は多いんじゃないでしょうか。
筆者も最初は「日本語で楽したい」という気持ちが強くて、桜だの侍だのを日本語でバンバン打ち込んでいたんですが、あるとき英語で全く同じ内容を打ってみたら、出てくる画像のクオリティも構図も別物で驚いた……という経験をしました。今回は感覚論で終わらせず、同じプロンプトを日本語版と英語版で実際にMidjourneyに投げて、結果を並べて検証してみます。
そもそもなぜ言語によって結果が変わるのか
結論から言うと、Midjourneyは英語をベースに学習されたAIです。米国発のサービスで、学習に使われた画像とテキストのペアも英語の情報量が圧倒的に多いという構造上の理由があります。
これは技術的にも裏付けがあって、MidjourneyのようなText-to-Image系のAIは、プロンプトの文章を「テキストエンコーダー」と呼ばれる仕組みで数値のベクトルに変換し、そのベクトルをもとに画像を組み立てていきます。多くの実装で使われているCLIPというエンコーダーに関する研究では、英語のデータで学習した場合と比べて、非英語圏の言語では性能が落ちる「多言語の呪い」という現象が報告されています(Meta CLIP 2の論文でも、英語専用モデルに比べて多言語対応モデルは英語の性能自体が落ちるというトレードオフが指摘されています)。
つまり「日本語が使えない」わけではなく、「英語に比べると学習データが薄く、細かいニュアンスまで正確に拾いきれない」というのが実情に近いです。単語を一つひとつの記号として認識してしまい、文脈やニュアンスがうまく反映されないケースがあるという指摘も、複数の国内メディアで共通して出てきます。
検証環境とルール
今回の検証は以下の条件で行いました。非デザイナーの方でも再現しやすいよう、特別なプラグインやAPIは使わず、Midjourney(Discord版)にそのまま日本語・英語のプロンプトを打ち込む、という一番シンプルな方法にしています。
- 使用ツール:Midjourney(v7、Discordのボット経由)
- 比較方法:同じ内容を「日本語のみ」「英語のみ」で作成し、同じパラメータ(アスペクト比・スタイル設定)で生成
- 翻訳:日本語→英語はDeepLをベースに、不自然な部分を筆者が手直し
- 評価軸:①意図した要素が画像に反映されているか ②構図・雰囲気の一致度 ③破綻(変な手や不自然な合成)の有無
検証①:人物+情景を含む複雑なプロンプト
まずは人物・場所・時間帯・感情表現までを盛り込んだ、要素数の多いプロンプトで試してみます。要素が多いほど、言語による解釈のズレが出やすいだろうという仮説です。
日本語プロンプト
夕暮れの京都の路地、着物を着た若い女性が傘をさして歩いている、雨上がりの石畳、提灯の灯り、映画のワンシーンのような雰囲気、シネマティックな照明

英語プロンプト
A young woman in a kimono walking with an umbrella through a Kyoto alley at dusk, wet cobblestone street after rain, glowing lanterns, cinematic atmosphere like a movie scene, dramatic lighting --ar 3:2

結果は正直、大きな差はそこまでない、という印象です。ただし、以下のような警告が出るほどの事象もあるとのことです。
国内の複数の検証記事でも共通して報告されている傾向で、たとえばSHIFT AI TIMESの検証でも、英語プロンプトでは家族3人がきちんと描写されたのに対し、同じ内容の日本語プロンプトでは人物の描写自体が欠けてしまったケースが紹介されています。ただし、現在のMidJurneyでは、かなり改善されているのかもしれません。
みなさんはどっちが好みでしょうか??
検証②:シンプルな単語の羅列プロンプト
次に、要素を絞ったシンプルなプロンプトでも同じ傾向が出るのか確認してみます。実務でよく使う「とりあえずラフに1枚欲しい」というシーンを想定しました。
日本語プロンプト
雪山の小さな山小屋、暖かい光、星空、水彩画風

英語プロンプト
A small cabin on a snowy mountain, warm glowing light, starry night sky, watercolor style --ar 4:3

こちらも大きな差は出ませんでした。要素数が少なく単語同士の関係もシンプルなため、日本語でも「山小屋」「雪」「星空」「水彩画風」がそれなりに反映されていました。ただし星空の描写密度や、水彩画特有の滲みの表現力は英語版の方が一段階上で、「シンプルな構図なら日本語でもそこそこ戦える」というのが率直な感想です。
これは海外の技術ブログでも紹介されている傾向と一致します。BuzyAiの検証では、Midjourneyは英語以外の言語も一定レベルで理解できるが、単語の少ない・構造がシンプルなプロンプトほど言語間の差が縮まりやすいと指摘されています。逆に文法が複雑だったり、比喩的な表現が混ざったりするプロンプトほど、非英語圏の言語では誤読が増えるとのことでした。
検証③:日本文化特有のモチーフ
最後に、「日本語ネイティブとして本当に伝えたいニュアンス」がどこまで再現できるかを見るため、あえて英語に翻訳しづらい表現を含めてみました。
日本語プロンプト
わびさびを感じさせる枯山水の庭、静寂、朝もやの中の石灯籠、禅の雰囲気

英語プロンプト
A Japanese zen garden with raked gravel and rocks, evoking wabi-sabi aesthetics, tranquil silence, stone lantern in morning mist, meditative zen atmosphere --ar 16:9

ここが今回いちばん面白かったポイントです。「わびさび」のような日本語特有の抽象概念は、日本語のまま入力しても意図が伝わりにくく、むしろ英語で”wabi-sabi”とローマ字化して概念として説明した方が、Midjourney側は的確に解釈してくれました。これはMidjourneyの学習データの中に、海外の禅ブームや日本文化紹介コンテンツを通じて「wabi-sabi」という単語自体が英語の文脈で相当量流通しているためだと考えられます。日本語の漢字表現そのものよりも、国際的に流通している英語のキーワードの方が、AIにとっては「意味の手がかり」が多いというわけです。
この現象は中国語圏の検証記事とも共通していて、知乎(Zhihu)上のMidjourney解説記事でも、中国語のプロンプトと、それを英訳したプロンプトとでは出力結果がまったく異なるとされ、基本的には英語での入力が推奨されています。言語の壁は日本語ユーザーだけの悩みではなく、英語圏以外のクリエイター全般が直面している構造的な課題だということがよく分かります。
実務で使える3つの落としどころ
検証を踏まえて、非デザイナーが実務でMidjourneyを使う際の現実的な運用方針を3つにまとめました。
①複雑な構図・人物ものは英語一択
要素数が多いプロンプトや、人物のポーズ・服装・場面設定を細かく指定したい場合は、迷わず英語で書きましょう。DeepLなどの翻訳ツールに一度通してから、不自然な語順や冗長な表現を人力で整えるだけでも精度はかなり上がります。翻訳結果をそのまま鵜呑みにせず、「これで伝わる英語か」を一度自分の目でチェックする一手間が地味に効きます。
②ラフ出し・アイデア出しの段階は日本語でOK
「とりあえず方向性を見たい」というブレストの段階であれば、日本語プロンプトでも十分に使えます。多少ディテールがズレても、大枠の雰囲気さえ掴めればOKというフェーズでは、翻訳の手間をかけずに日本語でどんどん試すのが効率的です。
③文化的なニュアンスは「日本語のまま」より「英語の専門用語」を使う
「わびさび」「侘び」「粋」のような日本文化特有の概念語は、日本語のまま入力するよりも、海外でも通用しているローマ字表記(wabi-sabi、ikigaiなど)を英語プロンプトの中に組み込む方が結果が安定します。これは非デザイナーが意外と見落としがちなポイントなので、ぜひ覚えておいてほしいコツです。
まとめ
今回の検証で分かったのは、Midjourneyの日本語プロンプトは「使えないわけではないが、複雑になるほど英語との差が開く」という、なんとなく予想していた通りの結果でした。ただし、シンプルな単語の羅列であれば日本語でも意外と健闘すること、そして「わびさび」のような文化的概念はむしろ英語のローマ字表記の方が伝わりやすいという発見は、実際に手を動かしてみないと分からなかった部分です。非デザイナーの立場からすると、すべてを英語で完璧に書こうとするより、ラフ出しは日本語、仕上げの一枚は英語という使い分けが、いちばん現実的な落としどころだと感じています。次回は英語プロンプトをさらに精度よく組み立てるための単語選びのコツを検証してみたいと思います。
#Midjourney #画像生成AI #プロンプト #AIイラスト #非デザイナー向け