活动直播字幕这个需求,最近两年问的人明显变多了。5月22日在苏州工业园区那场品牌年度沟通会上,甲方市场部的负责人在开播前四十分钟才想起来问我:"能不能加个字幕?听说现在都是AI自动出的。"我当时正蹲在地上理音频线,抬头说了句实话:能加,但你得先接受它会出错。那天我们最后是上了实时转写加人工兜底的组合方案,事后我把整场的转写记录导出来逐句核对了一遍,得出的结论跟很多人想的不太一样。
实时字幕的准确率到底有多少
先说数字。那场活动总时长两小时零七分,转写引擎一共输出了1863条字幕,我逐条比对之后,完全正确的是1591条,准确率85.4%。这个数字听起来还行,但要看错在哪里。
错误集中在三类:一是专有名词,品牌的产品代号"Vega Pro"被写成了"维加破";二是数字,"同比增长37.6%"变成了"同比增长三十七点六";三是南方口音,有位嘉宾是无锡人,说"这个事情"带点方言腔,机器识别成了"这个是情"。
真正致命的其实只有第一类和第二类。观众看错一个语气词无所谓,看到品牌名被写错,那种廉价感是遮不住的。摄行影像后来做活动直播字幕的时候,会在开播前把品牌词库、嘉宾名单、产品型号全部导进引擎的热词表里,那场之后我们再做类似项目,专有名词的准确率直接提到了98%以上。
延迟这件事比准确率更折磨人
实时字幕的延迟分两段:一段是语音识别本身的处理时间,通常1.2到2秒;另一段是叠加到画面上再编码推流的时间,大概0.5到1秒。加起来观众看到的字幕比嘴型慢2到3秒。
这个数字在纯演讲场景里能忍,但只要出现互动就露馅。那天下午有个抢答环节,主持人问完题目,字幕还停在上一句话,观众在弹幕里问"到底问的是啥"。后来我们的处理方式是互动环节直接把字幕关掉,只在演讲段落开着。听起来很土,但比让观众看着错位的字幕强。
有个反常识的点我想说清楚:字幕延迟不是靠加钱买更好的引擎就能解决的,它是语音识别这套技术的物理下限。谁跟你保证"零延迟实时字幕",要么是在吹牛,要么是把字幕做成了后期贴上去的假实时。
后期字幕贵在哪,值不值
后期字幕就是把录制文件拿回来,人工听写、校对、打轴、压制。一场两小时的活动,熟练的字幕员做完大概要六到八小时,加上校对一遍,行业里普遍按分钟计价。
那场沟通会甲方最后也要了后期版本,用于官网和视频号的长期挂载。我们交出去的成片字幕是逐句核对过的,专有名词零错误,标点规范,还按语义做了断句,一行不超过十六个字。这版素材他们用到了年底的招商材料里。
所以这两个方案压根不是二选一的关系。实时字幕解决的是"直播当下能看懂",后期字幕解决的是"这段视频能长期用"。预算够的活动,摄行影像一般建议两个都做,直播走实时,收工后补后期。
字幕的排版比内容更容易被骂
这一点很多团队会栽。字号太小手机上看不清,字号太大挡住演讲人的脸,描边不够在浅色背景上直接消失。
我们现在用的参数是这样的:1080P画面下字号取42到48像素,字幕安全区距离画面底边留出画面高度的8%,白字配1.5像素黑色描边再加30%透明度的黑色底衬。这套参数在手机竖屏裁切的时候也不会被切掉,因为它整体压在画面下三分之一的居中位置。
还有个细节:中文字幕一行最多十六个字,超过就换行,最多两行。有次我见过同行做的活动直播字幕,一行铺满三十多个字,观众在手机上根本读不完就跳走了。
双语字幕能不能上
能,但成本翻的不是一倍。中英双语的实时转写需要两条引擎并行,翻译环节还会额外叠加1到1.5秒延迟,最终观众看到的英文字幕可能比嘴型慢五秒。
那场沟通会里有三位外籍嘉宾,甲方最初想上双语。我们做完测试之后建议改方案:中文实时字幕正常开,英文改成后期补,直播时给外籍观众单独开一路同声传译音轨。这样既保住了直播的即时性,也没让英文观众听不懂。最后成本比双语实时方案还低了两成。
字幕机位和人力怎么配
很多人以为字幕是纯软件的事,其实现场得有人盯着。那天下午导播台旁边坐着一个字幕操作员,一台笔记本,两件事:一是遇到明显的识别错误立刻手动修正后重推,二是在敏感内容出现时按下屏蔽键把那一句字幕吃掉。
第二件事尤其重要。有位嘉宾在自由问答环节顺口提了另一家企业的名字,还带了点评价,字幕如果原样打出去就是白纸黑字的凭据。操作员反应快,那一句字幕没有出现在画面上,音频里一闪而过,谁也没在意。
摄行影像做活动直播字幕的标准配置是一人一机,不跟导播兼职。导播那两小时手上事情已经够多了,再让他盯字幕,两边都做不好。
场地环境对识别率的隐形影响
这是我在那场之后才真正重视起来的一件事。转写引擎吃的是音频,音频质量直接决定识别率的天花板。那天上午彩排时准确率只有七成出头,我们查了半天才发现问题出在音频链路上:调音台给编码器的那一路是混音输出,把现场返送音箱的声音也混了进去,形成轻微回授,人耳几乎听不出来,机器却被干扰得很厉害。
改成从调音台单独拉一路纯人声的辅助输出之后,准确率立刻从七成跳到八成五。所以真要提升活动直播字幕的效果,与其去挑引擎,不如先把音频做干净。
现场噪音也是一样的道理。开放式场地、有背景音乐的暖场环节、观众交头接耳的密集区,这些地方的识别率都会掉。摄行影像现在接活动直播字幕的项目,会先问清楚场地是封闭厅还是开放区,音响是线阵还是普通全频,这些信息直接影响我们报出去的准确率预期。
什么样的活动值得上字幕
不是所有活动都需要。我的判断标准很简单:内容密度高、信息量大、观众可能在无声环境下观看的活动,字幕是刚需;纯氛围类、表演类、以画面为主的活动,字幕反而是干扰。
年度沟通会、技术分享、产品发布、培训类内容,这四种必上。演出、开业、赛事、探厂类,可以不上。有个数据可以参考:那场沟通会的观众里,有41%是在静音状态下看完了超过十分钟的内容,这些人如果没有字幕,基本就流失了。
关于网络音视频内容的制作规范,国家广播电视总局的公开文件里有明确表述,可以查阅国家广播电视总局官网;语音识别相关的技术标准与行业进展,中国信息通信研究院也发布过不少公开材料。
一份可以直接照抄的字幕方案
预算有限就上实时转写加热词表,配一个字幕操作员,重点保住品牌名和数字。预算充裕就实时加后期双轨,直播用实时,收工48小时内交付后期精修版。有外籍观众就中文实时加英文后期,别硬上双语实时。
不管选哪种,开播前一定要留半小时做转写测试,把嘉宾名单和专有名词导进热词表,再从调音台拉一路纯净人声。这三步做完,效果差不了。
如果你手上有一场需要落地的活动,不确定该上哪种字幕方案、场地条件够不够,可以直接打 400-883-2046 找摄行影像聊。我们会先问清楚内容类型、观众构成和音频条件,再给具体的字幕配置和报价,不用你自己在网上到处比参数。更多实操内容整理在直播知识栏目和影像课堂里,导播台侧的配合可以看多机位活动直播切换,网络与推流条件的影响可以看活动直播网络方案实测。
做了这么多场我最深的体会是:字幕做得好的时候没人会夸你,做砸了每个人都看得见。它就是这么一个只有下限没有上限的活儿。
#摄行影像