CLEIA AI STUDIO

ChatGPT Image 2.5、何が変わった? Misakiで23枚生成して、局所編集・連続編集まで検証

この記事の目次
  1. まず、Image 2.5で何が新しくなったのか
  2. 比較条件:同じMisaki、同じ指示、各1回
  3. なぜこの4パターン?
  4. 1.髪型変更:4枚とも同じMisakiに見えるか
  5. 2.肌・髪・手:細かいほどリアルなのか
  6. 3.1980年代の街角:2の落ち着き、2.5の光
  7. 4.日本語の雑誌表紙:2も読める。組み方が変わる
  8. 追加実験:新しくなった「編集の強さ」を実際に試す
  9. 最初の8枚から、どう使い分けるか

新しい画像モデルが出ると、まず気になるのは「自分のキャラクターで使ったら、どこが変わるのか」。今回はMisakiの同じ参照画像を使い、Higgsfield上のGPT Image 2とGPT Image 2.5を比較しました。

髪型、肌と手、1980年代の街角、日本語の雑誌表紙。4つのプロンプトを両モデルに渡し、最初に生成した8枚をそのまま並べています。さらに15枚を追加し、局所編集・3段階の連続編集・透明背景・SunburstとMax品質、16コマのスプライトも検証しました。

公式発表の変更点を整理したうえで、実画像を見ていきます。先に今回の作例の印象を伝えると、今回の2.5は髪の描写と光の演出が目を引きました。一方、日本語は2もよくできていて、違いが大きかったのはレイアウトです。

4パターン一覧。各組の左が2、右が2.5 Flare
4パターン一覧。各組の左が2、右が2.5 Flare · タップで拡大

まず、Image 2.5で何が新しくなったのか

OpenAIは2026年9月8日にChatGPT Images 2.5を発表しました。主な改善は、参照した人物の特徴の保持、自然な光と質感、狙った部分だけの編集、繰り返し編集したときの一貫性です。生成の待ち時間はImages 2.0比で最大50%短縮したと説明しています。公式発表

Misakiのようなキャラクターを継続して使う立場では、特に「服や背景を変えても、顔と既存の仕上がりを保てるか」が気になります。今回の比較を読むときも、この観点を加えると違いが見えやすくなります。

変更点と、今回検証した範囲

改善点制作で期待できること今回の比較との関係
参照人物の特徴を保持衣装や場面が変わっても同じキャラクターとして使いやすい髪型・街角・表紙で目視比較
光や素材の描写肌、髪、布、ガラスに自然な質感を出す接写・街角で比較
局所編集の精度顔や構図を保ち、指定した物や文字だけを変更追加実験5で3モデルを比較
複数回編集の一貫性修正のたびに以前の変更や画質が崩れるのを抑える追加実験6で3段階を比較

上の改善点は公式発表の説明を要約したものです。実測済みの項目と未検証の項目を分けています。公式発表の編集・画質の説明

たとえば、今回の喫茶店画像から「カーディガンだけ青にする」、次に「瓶だけコーヒーカップにする」、最後に「看板だけ英語にする」。そのたびに顔、手、背景がどれだけ保たれるかを見れば、連続編集の進化を検証できます。この手順を追加実験6で実行しました。結果と拡大画像を後半に掲載しています。

FlareとSunburstは、同じ2.5でも役割が違う

モデル公式ガイドでの位置づけ今回の使用
GPT Image 2.5 Flare速度重視。日常の生成や、既存の2の品質を維持しながら待ち時間を減らしたい用途初回High、追加でMaxも使用
GPT Image 2.5 Sunburst品質重視。複雑な指示や、精密な編集が必要な用途追加実験でHighを使用

公式のプロンプトガイドは、Flareを速度に最適化した小型モデル、Sunburstを品質に最適化したベースモデルと説明しています。2の品質で足りる既存用途ではFlare、2では品質が足りない難しい用途ではSunburstから試す方針です。公式プロンプトガイド

ここは記事を読むうえで大切です。今回の「2対2.5」は、正確には「2対2.5 Flare・両方High」の比較です。初回比較は最高品質のテストではなく、後半でSunburst HighとFlare Maxを別途試しています。

なお、公式発表はFlareについて2より高品質と説明する一方、プロンプトガイドは2に相当する品質という表現も使っています。用途ごとの実画像で判断するのが適切です。公式発表、公式ガイド

Highの上に、xhighとmaxが追加

APIでは2.5の両モデルに「xhigh」「max」が追加されました。従来のlow・medium・highに加えて、より高い品質設定を選べます。初回はHighで揃え、後半の表紙テストでFlare Maxを追加しました。API更新履歴

また、2.5のAPIトークン単価は2と同じと案内されています。ただし、同じ単価は「1枚の料金が必ず同じ」という意味ではありません。 消費トークンや設定で料金は変わり、Higgsfieldのクレジット料金とも別です。API更新履歴

Sketch・テンプレート・共有は、ChatGPT側の新機能

画像モデルの更新と同時に、ChatGPT側の制作機能も増えています。

機能できること
Sketchラフな絵を描いて、構図や配置を画像生成に伝える
Templatesポスターなどの型を選び、内容を自分用に調整する
画像上のコメント直したい場所にコメントを付け、編集箇所を伝える
プロンプト共有使った指示を共有し、別の人が自分の写真で試せるようにする(公式発表に記載)

Sketchはモバイルアプリでの手順が案内され、Templatesは現時点でWorkモード未対応と記載されています。これらはChatGPTの操作機能です。Higgsfield上で2.5を選ぶだけで、同じ操作画面が使えるという意味ではありません。今回の制作では使用していません。ChatGPTの画像機能ヘルプ

「2.5で初めて」と言わないほうがよいこと

透明背景は2.5でも対応していますが、2にはすでにプレビュー対応がありました。任意サイズの出力も両世代に記載されています。「透明PNGや高解像度出力が2.5で初めて可能になった」という説明は避けます。画像生成APIリファレンス

同様に、画像内の日本語も今回の2の作例で十分読めています。見るべきなのは、文字が出せるかに加えて、指定どおりの文言・配置を維持できるかです。

今回2.5の4枚が先に完成しましたが、待ち行列や配信の影響を除いた速度測定ではありません。公式の「最大50%短縮」を、この8枚で再現確認したとは扱いません。

比較条件:同じMisaki、同じ指示、各1回

項目今回の設定
生成環境Higgsfield
比較モデルGPT Image 2 / GPT Image 2.5(Flare)
参照画像Higgsfieldに登録済みのMisaki、同じ1枚
解像度・縦横比両方2K・3:4指定
品質両方High指定
試行回数1条件につき各モデル1回、計8枚
生成後の修正なし。比較用に縮小配置し、外枠と見出しのみ追加
検証日2026年9月9日

2.5にはFlareとSunburstがあります。今回はHiggsfieldの標準バリアントであるFlareを使用しました。初回8枚はSunburstやMaxを含まず、後半の追加実験で扱います。OpenAIの紹介投稿、Higgsfieldの提供開始投稿も参照できます。

同じ「High」という設定名でも、両モデルで計算量まで等しいとは限りません。seedは指定しておらず、各1枚の作例比較です。以下の評価は今回の画像を目視した所感で、モデル全体の勝率ではありません。

全生成で使用したMisakiの参照画像
全生成で使用したMisakiの参照画像 · タップで拡大

なぜこの4パターン?

公開投稿を調べると、同じ顔から髪型一覧を作る比較投稿や、同じ型を試した別の作例が見つかりました。複数の作例が確認できた髪型比較を軸に、顔の接写、1980年代風の投稿から着想を得ています。

これに、日本での制作に使いやすい「日本語の雑誌表紙」を独自の実用テストとして追加しました。4項目すべてが流行ランキング上位だと確認したわけではありません。投稿の検索結果から確認できた題材を、Misaki向けのオリジナルプロンプトに組み直しています。公式発表でも1980年代風のプロンプトが流行例として紹介されています。公式発表

1.髪型変更:4枚とも同じMisakiに見えるか

髪型比較:左GPT Image 2、右GPT Image 2.5 Flare
髪型比較:左GPT Image 2、右GPT Image 2.5 Flare · タップで拡大

指定は、ボブ・ウェーブ・前髪ありのロング・ポニーテールの4分割。服、背景、表情を揃え、髪型だけを変えるようにしました。

両方とも4つの髪型と英語ラベルを出せています。 2は髪の面が滑らかで、整った仕上がり。2.5はウェーブの立体感や細い毛が見えやすく、髪型の違いがはっきりしています。

ただし、「髪だけ変更」の厳密さには注意が必要です。顔の見え方や頭の角度、白いシャツのしわも少し変わっています。髪型を変えても同じ人物に見えるかと、他の部分を固定できたかは分けて見る必要があります。

私の目では、両方ともMisakiらしさは残っています。今回なら、髪の質感を見せる用途では2.5、すっきりした一覧の印象では2も好みです。

2.肌・髪・手:細かいほどリアルなのか

接写比較:左GPT Image 2、右GPT Image 2.5 Flare
接写比較:左GPT Image 2、右GPT Image 2.5 Flare · タップで拡大

午後の強い横光、頬に右手を添えるポーズ。毛穴、細い髪、肌の色むらを描き、美肌フィルターを避けるように指示しました。

2も頬の質感や髪の細い線を描いています。2.5は頬や鼻の凹凸、光を受けた髪、白いTシャツのしわがさらに目に入ります。光と影の差も強く、写真としての立体感があります。

一方、両方とも参照画像の上から見下ろすような視点が残り、指示した「目線の高さのカメラ」への変更は明確ではありません。細部の描写だけで指示への忠実さを評価すると、この点を見落とします。

手はどちらも頬に自然に添えられていますが、指が重なっているため、5本すべてを独立して確認できる構図ではありません。「指が完全に正しい」とまでは判定していません。

3.1980年代の街角:2の落ち着き、2.5の光

1980年代風比較:左GPT Image 2、右GPT Image 2.5 Flare
1980年代風比較:左GPT Image 2、右GPT Image 2.5 Flare · タップで拡大

赤いカーディガン、クリーム色のブラウス、オレンジソーダのガラス瓶。夕方の喫茶店前で、店内の暖色と外の寒色を混ぜ、35mmフィルム風にする指示です。

この組が、ぱっと見の違いを最も感じました。 2は暗めで低彩度。少し引いた構図で、古いスナップ写真のような落ち着きがあります。2.5は人物に寄り、夕空の青と窓の橙色が強く、瓶の反射やカーディガンの編み目も見えやすくなりました。

看板の「喫茶みさき」は両方で読めます。2.5のほうが目を引く一方、褪色した控えめな写真という指示には2の色合いも合っています。ここは画質の勝敗より、作りたい雰囲気による選択です。

なお、これは1980年代をイメージした創作画像です。建築や衣装の時代考証を検証した歴史資料ではありません。

4.日本語の雑誌表紙:2も読める。組み方が変わる

日本語表紙比較:左GPT Image 2、右GPT Image 2.5 Flare
日本語表紙比較:左GPT Image 2、右GPT Image 2.5 Flare · タップで拡大

「みさきと旅する」「昭和を歩く、週末。」「喫茶店と路地裏の記憶」「2026年9月号」「特別定価 980円」の5つを指定。Misakiにはクリーム色のコートを着せ、赤いノートを両手で持ってもらいました。

今回、指定した主要な5つの文言は両方とも目視で読めます。2は大きな題字と縦書きの見出しで、街並みも広く見せています。2.5は横書きを中心にまとめ、顔を大きく配置しました。

スマホの小さな表示で人物と主見出しを伝えたいなら、今回の2.5の構図は使いやすそうです。旅先の風景や和文の縦組みを見せたいなら、2も十分に候補になります。

両方とも背景の看板などに指定外の文字らしい形があり、「他の文字は入れない」という条件を厳密には満たしていません。本文の可読性と、余計な文字を出さないことは別の評価軸です。

追加実験:新しくなった「編集の強さ」を実際に試す

ここからは公式説明の紹介にとどめず、Higgsfieldで15枚を追加生成した実験です。最初の8枚と合わせて計23枚。新しい画像を選び直すリトライはせず、各条件1回の結果を掲載します。

5.服の色だけ変える:人物と背景を保てるか

初回の喫茶店画像を共通の入力にして、2・Flare・Sunburstの3つへ「赤いカーディガンだけコバルトブルーに変更。他は保持」と指示しました。全モデル2K・3:4・High、マスクなしの自然言語編集です。共通入力がFlare製である点は、この小規模比較の偏りになり得ます。

元画像と3モデルの局所編集結果
元画像と3モデルの局所編集結果 · タップで拡大

3モデルともカーディガンを青にでき、人物の位置、瓶、看板、夕景という大きな構成を保っています。「服だけ変えて、同じ撮影の続きとして使う」という用途は、2.5でも実際に成立しました。

ただし、2もこの課題を達成しています。また、顔の細部や編み目まで元のピクセルが完全に固定されているわけではありません。この1回で「2.5だけができる」「局所編集は必ず2.5が勝つ」とは言えません。

6.3回連続で編集:前の変更は残るか、画質はどうか

各モデルの出力を、そのモデルの次の入力にしました。毎回元画像から作り直してはいません。

段階追加する編集維持を指示した主な部分
1カーディガンを青に顔、髪、瓶、背景
2瓶を白い陶器のカップに青い服、顔、背景
3看板をMISAKI CAFEに青い服、白いカップ、顔、背景
2回目:青い服を保ち、瓶を白いカップに変更
2回目:青い服を保ち、瓶を白いカップに変更 · タップで拡大
3回目:前の編集を保持し、看板の文字を変更
3回目:前の編集を保持し、看板の文字を変更 · タップで拡大

2・Flare・Sunburstのすべてで、3段階目まで「青い服・白いカップ・MISAKI CAFE」を積み重ねられました。物の置き換えに合わせた手の調整もあり、最初から別の場面を作るより構図を揃えやすいと感じます。

一方、編集を重ねると肌や髪に細かな模様のような変化が増えました。 3モデルとも見られ、特に顔を拡大すると分かります。2には斑点状のむら、FlareとSunburstには面が細かく分割されたような質感が現れています。今回の作例だけで劣化の少なさを一律に順位づけることは避けます。

元画像と3回編集後の顔。同じ画像座標を切り出して比較
元画像と3回編集後の顔。同じ画像座標を切り出して比較 · タップで拡大

ここは「2.5なら編集を繰り返しても劣化ゼロ」と書けない結果です。指定した内容を覚えていることと、素材としての自然な質感を保つことは別に評価する必要があります。顔の拡大は同じ座標の切り出しで、顔認証や定量的な人物一致率の測定ではありません。

この結果を踏まえると、実制作では途中の良い版を残し、顔・髪・背景を確認しながら修正を重ねたいです。記事では失敗箇所を隠す追加修正をしていません。

7.透明背景:本当に透けるPNGが返るか

同じ喫茶店画像から人物と瓶を切り抜き、透明PNGを要求しました。ここでは「背景が市松模様に見える」だけで合格にせず、返却ファイルのアルファチャンネルも調べています。

透明背景の検査。2の返却画像と、Flareを白・暗色背景に重ねた画像
透明背景の検査。2の返却画像と、Flareを白・暗色背景に重ねた画像 · タップで拡大
確認項目GPT Image 2(Higgsfield経由)GPT Image 2.5 Flare(同経由)
透明背景パラメーター未対応としてHiggsfieldが省略受け付けられた
返却PNGのカラーモードRGBRGBA
実際の透明度データなしあり
完全透明の画素なし約32.01%
出力の状態市松模様自体が描かれた画像透過はするが輪郭周りの残りに注意

Flareは実際に透過するファイルを返しました。しかし、白・暗色に重ねると、髪や肩の縁に細い暗色のフリンジが見えます。全体の切り抜きは成立していますが、細い毛や瓶の縁は使用する背景で確認したいところです。「透過PNGを作れる」と「そのまま使えるきれいな切り抜き」は同じではありません。

Flareのアルファ値は0〜254でした。255の完全不透明画素はなく、約67.99%が1〜254の範囲です。ただし254はほぼ不透明なので、この割合だけで「人物全体が大きく透ける」と判断してはいけません。使う背景の上で確認することが大切です。

2については、今回のHiggsfield経路が透明背景パラメーターを省略しています。OpenAI APIでの2の透明背景対応まで否定する実験ではなく、Higgsfield上の実用比較として読む必要があります。

8.SunburstとMaxも試す:上位なら明確に良くなる?

初回の日本語表紙と同じ参照・プロンプト・解像度を使い、Sunburst HighとFlare Maxを追加しました。下の左が初回のFlare Highです。左と中央でモデル差、左と右で品質設定の差を見ます。

Flare High、Sunburst High、Flare Maxの日本語表紙比較
Flare High、Sunburst High、Flare Maxの日本語表紙比較 · タップで拡大

3枚とも主な指定文言は目視で読めます。Sunburstは人物を左に、見出しを右に寄せ、Flare Maxは顔と見出しを大きく見せる構成になりました。いずれも顔を文字で隠さず、赤いノートとクリーム色のコートを描けています。

今回の1枚ずつでは、Highの時点で主要な文字が読めるため、「Maxにすると文字の正確さが明確に上がる」という差は確認できません。構図や衣服の見え方も変わっているので、気に入ったレイアウトを品質設定だけの効果とは断定できません。

上位設定を選ぶだけで必ず採用しやすくなる、という結果ではありませんでした。 同じ解像度で試しているため、Maxを選んだこと自体がピクセル数の増加を意味するわけでもありません。

9.16コマのMisakiを動かす:スプライトシート比較

読者から共有された比較動画の投稿(Chetaslua)、連続編集の質感変化を指摘する投稿(GENEL)、戦闘モーションのスプライトを試す投稿(8co28)も追加検証の参考にしました。投稿本文を参照しており、添付動画を通して視聴・採点した比較ではありません。

GENELさんの指摘に関連する質感変化は、今回の連続編集でも見られました。ただし、同一の条件を再現した追試ではありません。8co28さんの投稿は、シート生成の後に背景除去・4×4分割・位置調整・GIF化を行う工程を含んでいます。画像モデルが動画を直接生成した例とは分けて考えます。

今回は同じMisakiの参照画像から、赤いジャケット・クリーム色のシャツ・紺のパンツ・白い靴で、右向きのパンチ動作を16コマにする指示を出しました。2と2.5 Flareで2K・1:1・High、各1回です。白背景、等間隔の4×4配置、体の大きさと足元の位置を揃える条件も共通です。

Misakiの16コマ。左が2、右が2.5 Flare
Misakiの16コマ。左が2、右が2.5 Flare · タップで拡大

両方とも16体を4×4に配置でき、髪型・服の配色・右向きの構えをおおむね揃えられました。 2は輪郭が太めで頭身が低く、Flareは細身で髪や服の陰影が細かい仕上がりです。これ自体は画風の差で、性能の勝敗ではありません。

動作のつながりでは、2は腕を引いてから伸ばし、戻す途中のポーズが見られます。Flareはパンチの形が分かりやすい一方、8コマ目から9コマ目で伸ばした腕が構えへ急に戻ります。後半には、両方とも似た構えが繰り返されます。「16コマある」ことと「16コマすべてが滑らかな中割りになっている」ことは別でした。

左がGPT Image 2、右が2.5 FlareのMisaki。16コマのパンチ動作を比較
16コマ・1コマ120ミリ秒。位置補正・補間なし。

GIFは左上から行順に16等分し、1コマ120ミリ秒、約1.92秒のループにしたものです。足元の位置補正、補間、背景除去、描き直しは行っていません。コマごとの位置や大きさのずれもそのまま出ます。完成アニメーション用には、中間ポーズや接地位置の調整が必要です。

このテストでは、2.5でも一貫したキャラクター素材をまとめて作れることを確認しました。ただし、スプライト生成を2.5だけの新機能とは扱いません。今回の一発出力では、動きの滑らかさについて2.5の明確な優位は確認できませんでした。

追加実験から言えること

今回の2.5は、部分的な変更を積み重ねて同じ場面のバリエーションを作れました。透明度データを持つPNGも返しています。継続してMisakiの素材を作るうえで、これは実用的です。

ただ、連続編集の質感変化、切り抜きの縁、上位設定の効果には確認が必要でした。今回確認できた良さは、構図を大きく崩さず指定の変更を積み重ねられることです。ただし2も同じ課題を達成しており、2.5の優位性を実証するには、別の入力や複数回の比較が必要です。

Sketch・Templates・画像上コメント・プロンプト共有はChatGPT側の機能で、このHiggsfield実験には含めていません。速度も反復計測をしていないため、公式の50%短縮を実証したとは扱っていません。

最初の8枚から、どう使い分けるか

用途今回の画像からの判断
髪の質感や光の立体感を見せる2.5 Flareを先に試したい
落ち着いたレトロ写真2の低彩度な仕上がりも魅力
人物を大きく見せる表紙今回の2.5の構図が合う
縦組みの日本語と街並みを見せる今回の2の構図も使える

「2.5なら全部よくなる」とは、この8枚だけでは言えません。ただ、Misakiで試すと、髪や肌の描写、光の当たり方、人物と文字の見せ方に違いが出ました。

同じキャラクターを使う制作では、きれいかどうかに加えて「同じ人物に見えるか」「変えてほしくないところが残っているか」も大事です。今回の画像は修正せず掲載しました。自分の用途ならどちらを採用するか、ぜひ拡大して見比べてみてください。


制作・検証:ChatGPT Work / CLEIA AI STUDIO。画像生成:Higgsfield。参照キャラクター:Misaki。生成条件とプロンプトは下の検証資料から確認できます。画像は画素を変えない可逆圧縮で掲載しています。SNS投稿は取得できた本文・抜粋に基づき、添付動画の通し視聴や拡散数の横断集計は行っていません。

← ブログ一覧へ