AI 用 8 种唱法唱收假:歌、歌手和口型是怎么做的
同一句歌词「我的身体去上班,我的灵魂还在放假」,用 Suno 生成 8 种唱法,在本机用 Qwen-Image 画 8 位虚构歌手、用 InfiniteTalk 对口型,再用代码剪成 62 秒的 MV。这里是完整做法、可复制的歌词和提示词,以及我们踩过的坑。
播放 · 1 分 02 秒 · 7.5 MB要做的事
把同一句歌词「我的身体去上班,我的灵魂还在放假」,做成 8 段不同唱法的演唱,每段 6–7 秒,由 8 位虚构歌手对着口型唱出来,最后剪成一支 62 秒的竖屏 MV。
适合谁
- 想做 AI 音乐、节日热点短视频的内容创作者。
- 只做歌曲这一步,会用 Suno 就够了。画歌手和对口型这两步用的是本机 ComfyUI,需要一台有独立显卡的电脑,门槛高一些。
工具和耗时
| 步骤 | 工具 | 条件 | 本期耗时 |
|---|---|---|---|
| 生成歌曲 | Suno | 付费套餐(本期用 Pro),下载有次数额度 | 8 种风格共生成 22 版 |
| 截出两句歌词 | 代码 + 豆包录音文件识别 | 火山引擎 API Key | — |
| 画歌手 | Qwen-Image(本机 ComfyUI) | 8 GB 显存的笔记本显卡(RTX 5060) | 每张约 90 秒 |
| 对口型 | InfiniteTalk(本机 ComfyUI) | 同上 | 每段约 15 分钟,8 段共约 2 小时 |
| 剪辑 | Python + FFmpeg | — | — |
做法
1. 写歌词
整首歌照常写,但要有两句能单独成立、一听就记住的句子。视频只用这两句,8 种唱法唱的是同一句,观众才好比较。
[Verse] 我的身体去上班 我的灵魂还在放假 闹钟响了第三遍 梦里我还在海边呀 [Chorus] 我的身体去上班 我的灵魂还在放假 工位上坐着的那个人 其实只是我的躯壳啊
2. 在 Suno 生成 8 种风格
同一份歌词,每种风格各生成一次。每条风格提示词后面都加上 vocals start immediately, no instrumental intro,让歌一开头就唱。每种风格挑一版,唱词清楚、开口早的优先。
| 唱法 | 风格提示词 |
|---|---|
| 1 史诗战歌 | epic orchestral, cinematic war drums, massive choir, heroic male vocal |
| 2 童声儿歌 | children's song, cute, glockenspiel, ukulele, bright childlike vocal, nursery rhyme |
| 3 金属嘶吼 | heavy metal, distorted guitars, double bass drums, screaming male vocal |
| 4 KTV 苦情 | sad mandarin ballad, piano, strings, heartbroken male vocal, KTV |
| 5 广场舞 DJ | chinese square dance DJ remix, four on the floor, cheesy synth, energetic female vocal |
| 6 美声歌剧 | opera, bel canto tenor, grand orchestra, dramatic |
| 7 说唱 | chinese hip hop, trap beat, 808, fast male rap |
| 8 古风戏腔 | chinese traditional, guzheng, erhu, xiqiang opera style female vocal, gufeng |
歌曲标题里写上编号和风格,例如「收假1-史诗战歌」,下载后才分得清。
3. 截出两句歌词
在每首歌里找到「我的身体去上班,我的灵魂还在放假」第一次出现的位置,截到「放假」的尾音结束、下一句开口之前。古风戏腔唱得慢,只用了第一句。截好的 8 段,每段 5.9–7.4 秒。
我们先把立体声中间的人声突出出来,再用豆包的录音文件识别拿到每个字的时间,自动定位。只做一两首的话,用剪辑软件边听边截更快。
4. 画 8 位歌手
每种唱法写一段人物描述,再加上一段所有歌手共用的画面要求,用本机的 Qwen-Image 生成 720×1280 的竖图。
1 史诗战歌
2 童声儿歌
3 金属嘶吼
4 KTV 苦情
5 广场舞 DJ
6 美声歌剧
7 说唱
8 古风戏腔
竖构图,胸部以上的中近景,人物位于画面中央偏上,正面面对镜头,脸部清晰完整,嘴巴张开正在唱歌,嘴部没有任何遮挡。真实人物摄影质感,真实皮肤纹理,真实发丝,电影级光影,85mm人像镜头,浅景深,超高细节,照片级真实感。画面中没有任何文字、字母、数字、标志或水印。
8 段人物描述
- 史诗战歌:一位30岁左右的中国男性上班族,短发,面容坚毅,身穿厚重的银色古代铠甲,铠甲里露出白衬衫领口和深蓝色领带,胸前挂着一张蓝色挂绳的空白白色工牌。他站在硝烟弥漫的城市战场上,背后是高耸的写字楼群和燃烧的金色夕阳,空中飘着火星与烟尘。他昂首挺胸,张大嘴巴激昂高歌,眼神坚定,像即将出征的将军。史诗电影海报般的戏剧性光影,逆光轮廓光,暖橙与冷蓝的对比色调。
- 童声儿歌:一位24岁左右的中国年轻女性上班族,圆脸,笑容灿烂,扎着两个蓬松的丸子头,戴着粉色兔耳朵发箍,穿着浅黄色针织开衫和白衬衫,胸前挂着贴了卡通贴纸的空白工牌。她身处色彩明快的童话风格办公室,桌上摆满彩色积木、气球和小黄鸭玩具,背景柔和明亮。她微微歪头,张嘴开心地唱着儿歌,表情天真可爱。明亮柔和的漫射光,粉黄蓝马卡龙色调。
- 金属嘶吼:一位35岁左右的中国男性上班族,黑色长发凌乱飞扬,额头有汗珠,穿着黑色铆钉皮夹克,里面是皱巴巴的白衬衫和松开的领带,挂着空白工牌。他在深夜昏暗的办公室里,背后是一排排电脑屏幕发出的冷光,空中有火花和烟雾。他仰头张大嘴巴用力嘶吼,表情狂野。强烈的红色与蓝色舞台光,高对比,摇滚演唱会氛围。
- KTV 苦情:一位28岁左右的中国男性上班族,穿着皱了的深灰色西装和白衬衫,领带歪着,挂着空白工牌。他坐在KTV包厢里,手握麦克风放在下巴下方,麦克风不遮挡嘴巴,眼眶泛红含着泪光,深情又心碎地张嘴唱歌。背景是霓虹灯和闪烁的小彩灯,桌上放着笔记本电脑和一盒冷掉的外卖。迷离的霓虹光影,伤感氛围。
- 广场舞 DJ:一位50岁左右热情开朗的中国阿姨,烫着时髦的短卷发,戴着大号金框墨镜,脖子上挂着头戴式耳机,穿着亮红色运动外套,挂着空白工牌。她站在夜晚写字楼楼下广场的DJ台前,一手高举红色绸扇,一手搭在打碟机上,张嘴兴奋地唱着。背景是彩色舞台灯、音箱和跳广场舞的人群剪影。热闹欢快的派对灯光,鲜艳饱和的色彩。
- 美声歌剧:近景构图,镜头只拍到胸口以上,人物的头和肩膀占据画面上半部分,脸部大而清晰。一位40岁左右、体型微胖的中国男高音,梳着整齐的背头,留着小胡子,穿着黑色燕尾服和白色领结,胸前别着空白工牌。他在现代会议室里,一只手按在胸前,张大嘴巴深情演唱歌剧,表情夸张投入。一束聚光灯从上方照在他脸上,背景是昏暗虚化的会议室和空白投影幕。古典歌剧舞台光效,金色暖光,庄重又滑稽。
- 说唱:一位25岁左右的中国年轻男性说唱歌手,寸头,戴着粗金链子和反戴的棒球帽,穿着宽松的黑色连帽卫衣,脖子上同时挂着空白工牌。他站在早高峰的地铁车厢里,一只手做出说唱手势,张嘴快速说唱,表情自信酷炫。背景是车厢扶手和模糊的通勤人群,霓虹绿色与紫色光效,街头嘻哈风格,动感光影。
- 古风戏腔:一位25岁左右的中国年轻女性,乌黑长发盘成古典发髻,插着精致的发簪,穿着淡青色古风汉服,怀里抱着一台打开的笔记本电脑,汉服外还挂着空白工牌。她站在古典园林的亭台中,背后是月光下的江南白墙黛瓦,远处是现代写字楼的灯火。她微微侧身回眸,张口唱着戏腔,眼神婉转。月光与暖灯的柔和光影,青白淡雅的色调,东方美学。
美声歌剧的第一版是全身像,脸在画面里太小,加上「近景,只拍到胸口以上,脸部大而清晰」后重画了一张。
5. 对口型
把歌手图和截好的人声交给 InfiniteTalk,生成唱歌的视频:432×768,每秒 25 帧,每 81 帧一段,段与段之间重叠 9 帧接上,采样 6 步,并加了 lightx2v 加速 LoRA。一段 7 秒左右,在 8 GB 显存的笔记本上约 15 分钟。
驱动口型的是人声突出后的音轨,成片里放的是原曲。
6. 剪辑
用代码把「假期余额 0%」的开场、8 段演唱和投票片尾接起来,各段音量拉平,切换处加音效。右上角的 AI@π 和字幕都是后期叠加的,不让模型生成文字。
需要人工核对的地方
- 唱词:Suno 可能唱错字或改字,截取前先听一遍。
- 截取位置:每段从第一个字开始,尾音完整,没有带进下一句。
- 歌手画面:脸要够大,嘴不能被话筒或手挡住,画面里不要有字。
- 口型:逐段看一遍,口型和声音对得上再用。
- 标注:发布时选择「含AI生成内容」,并说明人物为虚构。
常见错误
- 风格提示词里没写「一开口就唱」,前奏太长。即使写了也不保险:我们选用的 8 版里,史诗战歌、金属嘶吼和 KTV 苦情的人声都在 14–19 秒后才开始,只能从中间截。
- 人物画成全身像,脸在画面里太小。
- 歌曲标题不写编号和风格,下载后分不清;我们有一首说唱的标题写错了,下载后才改过来。
- 伴奏很响时,直接拿原曲做语音识别几乎认不出唱词,要先把人声突出出来。
这期的局限
- 只用了 Suno、Qwen-Image 和 InfiniteTalk 这一套工具,没有和其他音乐、绘图或对口型工具比较。
- 耗时是在一台 RTX 5060 笔记本(8 GB 显存)上的单次记录,换一台机器会不同。
视频号评论区正在投票:你最喜欢第几种?票数最高的那版,下期唱整首。
