上周四凌晨一点,许静把第十七首配乐拖进音轨,听完,又删了。

儿子在旁边的小床上翻了个身。她手一抖,音量推子拉过了头,故事声被音乐盖住。她往回拉,又太轻。

那天晚上她导出了第八个版本,天快亮才关电脑。

她做的是儿童有声书。

本行是广告文案,生完孩子后在家带娃,顺手接下给平台录儿童有声书的活儿。听起来简单,念稿子谁不会。

真做起来是两件事。先把人声录好,再去找背景音乐配上去。她电脑里有个文件夹叫配乐库,两年攒了一百多首,每录完一本都要从头翻一遍。

这本讲小熊睡觉,得找安静的。那本讲小兔子跑,要轻快一点。

找到差不多的拖进去试听,不对就换;换到对的,又发现人声停下的那半秒,音乐刚好在往上走。那就再调,剪短音乐,或者把人声往前挪。

她还是没睡好。

那天凌晨她坐在那儿,脑子里转的还有这个月的稿费,够不够付孩子的托班费;她跟我说,人在那种时刻,很难对一段背景音乐保持耐心。

吵。

桌上的一盏黄铜台灯
桌上的一盏黄铜台灯

一本二十分钟的书,录人声四十分钟,配乐两个半小时。

这还没算返工。平台听完说第三分二十秒背景音有点抢,她得回去重新对一遍。

她那阵子最烦一句话,音乐再轻一点。轻到听不见,那配它做什么。

还有一件事让她崩溃。书都做完了,平台说要改成活泼风。一整套配乐全换,等于重做。

那段时间她手机里全是备忘:哪本书用了哪首曲子,音量调到多少,第几分钟做淡出。记得比记账还细。

她试过在文件夹里给每首曲子加标签,安静的、轻快的、带一点风铃的。标完之后发现,真到用的时候,标签一个都没派上用场,因为同一段音乐放进不同的故事里,效果完全不一样。

白标了。

她说配乐这活儿最磨人的地方,在于你永远说不清做到哪一步算好,只能一遍遍地听,一遍遍地改,直到自己先受不了为止。

她停不下来。

她后来把那段日子算了一笔账。一本二十分钟的儿童书,从录到定稿前后要三天,其中一大半时间花在配乐上。她试过偷懒,直接套用上一本的音乐,结果平台听完说两本书听着太像,退回来重做。也试过去买素材站的会员,一首一首挑下来,人更累。她说那半年最难受的,是念完之后那几个小时的反复折腾。

写满字的一本笔记
写满字的一本笔记

上个月,她试了个新东西

十月一日,Suno 上线了一个叫 Speech 的功能。

她是从一个做播客的群里看到的消息。以前的流程,是先把话念出来,再另外找一段音乐拼上去。Speech 把两件事并成了一件事。

你给它一段文字,它在同一时间决定这句话怎么说、哪里停、音乐从哪里进、在哪里淡出。停顿和配乐同时发生。

Suno 说这是业界第一个把语音和音乐当成一条连贯音轨、一起生成的模型。以前那套先出人声再贴配乐的做法,被它并成了一次生成。

这是它第一次对外开放。过去一个月,Suno 只找了一小批用户内测,现在放到了公测。

用法也简单。贴进去一段文字,可以是灵感、一首诗、一段稿子,再描述你想要的音色和音乐风格,点生成。

做音频这行的人,对这条消息的反应分成两拨。做播客的说,终于不用在音乐库里泡一下午;做配音的说,机器连停顿都替你决定了,那还要配音演员做什么。许静的态度在中间。她说这功能省掉的是找配乐那段体力活;一段旁白念得好不好听,哪里该轻、哪里该留白,最后还是得看人。她那本小熊的书,平台后来说还是第一版最好听,因为那版是她自己念的。

录音棚里的电容麦克风
录音棚里的电容麦克风

试完第一段,她愣了半分钟

她贴了一段小熊睡觉的稿子,挑了个温柔的音色。

念到小熊闭上眼那句,声音自己慢了下来,后面的音乐跟着软下去。换到它梦见一片森林,节奏又轻快起来,音乐也亮了一下。

这些以前要手动调半小时。那天十一点半她就睡了。

调音台上的推子
调音台上的推子

有两处坑,她提醒我留意

一处是口音。

生成的时候,偶尔某个字会飘。她做普通话儿童书,大部分没问题,个别句子会带一点奇怪的口音。

小熊被念成小雄。孩子听着没感觉,她听着浑身难受。这种地方只能重新生成,或者单独改那一段。

另一处是停顿。

模型给的停顿很有戏剧感。该停的地方停,不该停的地方也停一下。

讲故事当然要有起伏,可睡前故事不用念成话剧。停顿太夸张,孩子听着怪,家长也觉得假。她的办法是手动删掉一些停顿,把节奏拉平一点。

现在她还会翻十七首配乐吗。她说不了,先生成,听着不对就改提示词重来。

她不用再给音乐让路了。

就这么简单。

省下来的时间,她陪儿子把那本小熊的故事真读了一遍。儿子说,妈妈你念得比手机好听。

桌上的一副耳机
桌上的一副耳机

这功能现在还是 Beta,口音会飘,停顿会夸张,偶尔还要她救场。它离取代一个成熟的配音流程还远,可它已经替她把最耗人的那一段接了过去。

她不用再当那个半夜翻一百首曲子的人了。

一对陶瓷台灯
一对陶瓷台灯

你平时做音频,最耗时间的是哪一步。