AI生图新人的真实体验与思考

MJ中文站 2026-08-29 09:36:09

哈喽,大家好,我是小珠宝。这期想聊聊作为AI创作新手在文生图过程中的实际体验和一些困扰,也顺便为自己打打气。

之前我主要使用MidJourney、海螺(HeyGen)生成视频,Na banana(即“香蕉”模型,应为“Banana”或指代某国产模型,此处按原意保留)用得较少,豆包也尝试过一点。

我对这些工具的初步印象是:MidJourney风格化强,但对写实需求不太友好。之前在公司做一个写实类项目时,更多依赖Banana;豆包虽然中文理解能力最强,但它的滤镜感最重,“土味”明显——高饱和、低审美,画面常常丑得离谱。不过,正因为它最听得懂汉语,这次时隔许久重新开始接触AI创作,我决定优先试试国产工具。

起因是最近B站有个AI视频大赛,我在小红书上联系了一个队伍,对方说:“你先出几张图,合适再加入。”于是昨天我集中测试了几款国产工具:先试了可灵,再试即梦。可灵的问题在于多图参考功能形同虚设——它要求上传人物、背景、风格三类参考图,但一旦你上传一张纯背景图,就无法继续添加其他参考图了。这个限制让我很快放弃。

随后我把重心转向即梦。昨天90%的时间都在用它,后期也穿插用了点Banana。

即梦的人物把控尚可,尤其在我上传几张人物图并配合语言描述时。但问题很快浮现:如果仅靠纯文字描述、不提供任何参考图,它生成的图像质量极差。这让我想起早年用Stable Diffusion时的感受——除MidJourney和Banana外,绝大多数模型在纯文本驱动下产出的画面都混乱无序:物品堆砌毫无逻辑,构图失衡,缺乏基本美感。

我曾试着用语言优化一张自己觉得还不错的初稿,结果越调越糟。后来我上传了几张风格化参考图(比如暖黄色调的室内场景),但它只机械地把整张图染成黄色,完全无法还原原图中的光影层次、材质细节或空间节奏。

折腾许久后我意识到:必须回归参考图驱动。于是我从小红书找来一批高质量室内参考图,再将人物合成进去,立刻得到一张氛围出色、质感在线的图。但问题又来了——参考图里的家具摆放并非我所需,甚至缺少我想要的具体物件。于是我又尝试用文字描述调整布局,结果因缺乏对应参考图,模型开始“画蛇添足”,越改越失真。

我把这两版结果发给小红书上的合作者,他们反馈:仅靠参考图+人物合成的版本效果更好;而所有试图用精确文字指令逼近目标的尝试,反而效果更差。他们的看法是:给模型更多模糊空间,有时反而能激发意外的好结果。

第二阶段,我转而测试Banana。直观感受是:它的整体出图水准和审美稳定性,明显优于当前主流国产工具。目前我的浅层判断是——MidJourney和Banana即使仅凭简单文字+随意几张参考图,最终成图质量仍普遍高于国产同类产品。

昨天跑完全部流程后,我今天真的不想再打开了,甚至想直接放弃。因为投入大量时间,却得不到一张自己或他人认可的图——那种“花了半天,最后弄出两坨屎”的疲惫感非常真实。

更让人沮丧的是,小红书上对接的人说话还特别难听,一度让我想扭头就走。但我坚持下来,是因为想做出真正能放进作品集、或用于求职相关岗位的成果。

今天我突然想到一个与自己相关的原创剧本,迅速写下故事大纲。写完已精疲力尽,于是转而向豆包求助:“我已有故事大纲,下一步该如何推进?”我问它能否将大纲转化为分镜脚本,并细化到具体画面、动作与对话。豆包给出了第一版科普风脚本,但我觉得不对——这不是我要的纪录片式表达,而更像宣传片。我再次提出修改需求,它调整后基本符合预期:以故事为载体承载科普信息,而非干巴巴的知识罗列。

我下载了这版脚本,又自行优化了一遍结构,但发现它仍缺乏叙事吸引力。如今优秀的科普视频往往融入幽默台词、表情包、腹黑旁白等手法,让内容既准确又有趣。既然要做,就该尽力做好。可一想到“做好”,心又沉了下去,于是再次卡住,转而录下这段视频。

我越来越觉得:用AI做全流程创作,其实非常累。表面看是提效,实则每一步仍需深度思考。于是我再次向豆包提问:“现在有剧本大纲,也有文字版分镜,下一步该做什么?”就在敲下这句话的瞬间,答案已在脑中浮现——接下来该画分镜草图。如果不想手绘,那就该去找参考图:动画截图、B站视频帧、风景示意图……这本就是专业流程中的标准环节:先有脚本,再配参考,再执行视觉化。