昨晚老周给我发了张截图,笑了一会儿。
他把四个字丢给两个翻译模型。一个 9B 的,一个 7B 的。
这四个字是「狒瘾犯了」。7B 那个愣了半天,翻出来一句谁也看不懂的英文。9B 那个想了想,译对了。
老周做字幕组八年。他说这四个字是游戏圈的土话,意思是特别想玩某个游戏,想得浑身难受。没在这个圈子里泡过的人,看到这四个字只会去查字典。

黑话是翻译的照妖镜
老周跟我讲过一个更扎心的活。去年他接游戏直播切片,满屏都是「这把稳了」「心态崩了」「爷青回」。翻译软件照着字面译,念出来像说明书,观众看一眼就划走了。
他说这类词字典里根本没有。哪个是调侃,哪个是嘲讽,得靠泡出来的。
昨天 B站的 Index LLM 团队放出了一套翻译模型,名字叫 Index-Translate。2B、9B,还有一个 35B-A3B 的预览版,覆盖 150 种语言,权重直接挂在 Hugging Face 和 ModelScope 上。官方给的例子,恰好就是「狒瘾犯了」这句。
老周关心的不是参数表。他关心的是,这玩意儿能不能听懂人话。

一句台词,能给三个长度
做字幕的人都有个外人不知道的痛。中文翻英文,意思翻对了,长度不对。
字幕一行就那么宽,英文译出来三个词,挤不下;挤到第二行,观众还没看完,镜头已经切走了。老周的办法是手动删,删到最后,意思跟着跑偏。
这套模型里有个东西叫 Index-Homura,干的事就是按目标音节数调译文。同一句话,它给 10 音节、14 音节、18 音节三个版本,哪个塞得进时间轴就用哪个。
老周看完说了一句,这才是懂行的做法。
他这句话,我记了很久。

32K 长文里的「王妃」
短句翻译早就够用了,难的是长文档。
老周栽过跟头。去年他翻一部六十多集的年代剧,从第二十集开始,主角的绰号换了四种叫法,他改到凌晨三点,第二天重做了整整两集,后来干脆把译文里的称呼做成一张对照表,贴在桌角。
老周之前翻过一份二十多页的脚本,主角是位王妃。前面翻得好好的,到中段模型突然管她叫公主,到后面又变成了那位女士,同一份文件里三种叫法,配音的时候对不上,前面几十页全白做;他后来是拿一张纸把人名和称呼列出来,翻一页对一次,硬改完的。
B站这套里有个 Index-NativeLong,专门治这个。官方案例给的是 32K 的长文,从第一页翻到最后一页,「王妃」始终是王妃。老周说,做过长项目的人都懂这件事有多要紧。

它还能照着原声做配音
另一个模块叫 Index-Echo,能照着源说话人的声音特征,生成目标语言的字幕或者配音。
老周听完这段沉默了几秒。他组里有个姑娘,专门给外语视频配中文,一天下来嗓子是哑的。他不确定这功能现在能做到什么程度,但方向他看明白了。

门槛换了个位置
老周最后跟我聊了他的判断。以前做翻译是门手艺,会几门外语,能吃一辈子饭。现在模型把词摆到位,快得吓人,成本低得接近不要钱。
那还剩下什么,剩下的是决定哪个词才算对。「狒瘾犯了」该怎么译,得懂这个圈子的人来定,模型还定不了;这八年泡出来的手感,机器一时半会儿长不出来。
以前卡在懂不懂外语,现在卡在懂不懂这群人在说什么。跨境卖家那边,情况类似。语言这关好过了,新问题是你得知道同一句话,美国人看了会笑,还是日本人看了会懵。

老周说,他准备把这套模型下下来试试。试完再决定,是接着熬夜改轴,还是能早点睡。
你身边有没有做字幕、做跨境或者常看外文内容的朋友,他们最近被翻译绊住过吗。