GPT Image 2 全面测评:真实能力边界与适用场景
我连续用了两周 GPT Image 2,前后出了大概 300 多张图,付费账号按张计费,也试了免费额度的版本。下面说的都是实战里的真实体感,不是发布会话术,能用的地方和翻车的地方都摊开讲。
它真正强的地方
文字渲染是最大惊喜。以前用 Midjourney 出带字的图基本靠运气,GPT Image 2 能稳定把短句、招牌、菜单、海报标题写对。我让它出一张"深夜拉面店招牌,灯箱写着 営業中",一次就过了。做电商主图、活动海报,这一条直接省掉后期 PS 打字。
世界知识帮了大忙。你描述"1990 年代香港茶餐厅,玻璃上贴着挂历,塑料凳,吊扇",它能把那个年代的氛围凑出来,不用你逐条列参考图。这对做概念图、氛围图特别省事,脑子里的画面直接说就成。
指令遵循很准。说"左边一只猫,右边一杯咖啡,咖啡冒热气,背景是木质桌面",元素关系和位置基本不错位。局部编辑也好用:上传一张图,说"把背景的树去掉,换成城市夜景",它真能改,不用进 PS 再抠。
它的边界在哪
人像一致性是软肋。单张人像质量很高,但你要连续出同一个人的多张不同姿势,脸会漂。目前能缓解的办法是固定种子值、或者拿一张参考图让它"保持这个人物的长相",但做不到影视级稳定,做系列角色图得靠后期对齐。
手部和极细结构仍会翻车。多人握手、数手指、复杂珠宝,偶尔出怪异关节。超长段落文字也会有错字漏字,超过两行的正文建议后期替换,别指望它一次写对一篇小作文。
和 Midjourney v6 比,GPT Image 2 的"艺术感"没那么浓。MJ 默认出片更有电影构图和光影氛围,GPT Image 2 偏"准确但平"。你要的是美感炸裂的壁纸,MJ 更顺手;你要的是"按我说的来",选 GPT Image 2。
和几个对手的差异
| 维度 | GPT Image 2 | Midjourney v6 | 即梦 | Flux |
|---|---|---|---|---|
| 文字渲染 | 强 | 弱 | 中 | 中 |
| 指令遵循 | 强 | 中 | 中 | 强 |
| 艺术氛围 | 中 | 强 | 中 | 中 |
| 中文理解 | 强 | 弱 | 强 | 弱 |
| 局部编辑 | 支持 | 弱 | 支持 | 需外挂工具 |
什么场景该用它
带文字的营销图、电商主图改背景、快速概念稿、把草图或照片精修成不同风格,这几个它最划算。纯艺术探索、追求惊艳氛围的大图,还是 MJ 或 Flux 更爽。把它当"听话的执行工具",别当"灵感源泉",定位就对了。新手从它上手也最友好,不用背一堆参数。
按官方定价,一张图约几分到一毛多美元,做批量物料成本可控。下一篇我会拆它的提示词怎么写才出效果。