12月12日,日本艺术家村上隆在今日头条、西瓜视频、抖音同步开启首场中国直播,吸引近80万人次在线观看。直播过程中,村上隆向中国观众分享了他近期的图书作品以及新的作品灵感,著名摄影师蜷川实花和知名主持人蔡康永也与村上隆探讨了艺术理念等问题。
本场直播中,火山引擎旗下的火山同传产品独家全程提供了实时智能同传字幕,通过深厚的技术实力和稳定的产品服务,给中国观众带来了流畅的跨国直播体验。
火山同传对外首秀 打造“影院级字幕”
在传统会议、直播场景中,机器翻译解决方案提供的字幕通常是“打字级字幕”,观看这种字幕,观众需要投入很大的精力在浏览和理解字幕上,观众体验非常差。原因有两个:一是“打字级字幕”全程会不停跳动,观众的视线无法聚焦,容易造成视觉疲劳。另一个,每句字幕的停留时间过短,观众往往来不及看完就会跳到下一句。
为了提升用户体验,此次村上隆的跨国直播中,火山同传创新性地推出了“影院级字幕”方案,与视频流整合后流畅地输出完整的译文语句,在屏幕上逐句显示。观众可以清楚看到精准的字幕结果,免受字幕跳动带来的视觉干扰。
在本次村上隆的跨国直播中,火山同传的“影院级字幕”方案就引起了观众们的好奇和质疑。在弹幕里,就有个别观众质疑真的是否在直播。
火山同传产品经理表示:“这种质疑在我们看来,是对我们的肯定。为了实现‘影院级字幕’效果,并在直播中保证‘音画字同步’,火山同传准备了一套延时字幕方案。”
该方案中,音频被推送到主控端完成机器同传后,人工利用直播的推拉流延时时间,在机器同传的结果上进行内容校对,以保证投屏字幕的强可读性。之后,火山同传的画面延时功能,能够保证校对后的字幕在延时结束后准时送出,与延时后的画面整合并同步推流到观众端,最终呈现出添加了高质量字幕的直播画面。
保证一场专业直播同传字幕质量的关键是定向的技术优化。字节跳动杰出科学家、人工智能实验室总监李磊介绍,在村上隆的直播中,火山翻译团队除了采用前沿的神经网络机器翻译技术进行模型训练外,还针对直播场景引入了领域适应技术,将村上隆以往的访谈和演讲数据用于优化算法,并对口语规范化、专业术语定制都进行了特殊优化处理,确保最终呈现的字幕能够简洁、精准。
百项专利、50余篇学术论文 打造专业翻译产品矩阵
火山同传“影院级字幕”的背后,是火山翻译团队超过40位顶尖科学家、工程师打磨出的机器翻译模型。
火山翻译由字节跳动计算机研究科学家、工程师、产品经理、产品运营和语言专家组成的专业团队研发,拥有包括火山同传、火山翻译API、火山翻译Studio、浏览器翻译助手等在内的一系列矩阵产品。
目前,火山翻译已支持超过50个语种的全语向互译,应用于办公、娱乐、新闻等各类场景中,每天为来自全球的过亿用户提供优质的翻译体验。
火山翻译团队拥有百余项技术发明专利,在人工智能顶级国际学术会议已发表50余篇学术论文。其自研的高性能序列推理引擎LightSeq,推理速度业界领先,比原生系统提高10倍,翻译速度可达20,000词/秒。
在近期刚结束的机器学习顶级赛事——2020国际机器翻译大赛(WMT2020)中,经过全球语言专家充分评估,火山翻译在「中文-英语」语向翻译项目上力压群雄,以显著优势获得世界冠军。
在人工智能领域,“如何让AI更好地赋能行业”一直是个值得探索的方向。火山翻译的火山同传在这个方向上对外迈出了坚实的一步,将机器同传的高效快捷和人工翻译的精准进行结合。此次村上隆跨国直播中,火山同传就为观众提供了“影院级字幕”的直播体验,实现“1+1>2”的效果。
李磊表示:“火山翻译将致力于打造前沿研究、产品研发和用户反馈的闭环,在迭代中快速进步。希望火山翻译能帮助更多用户进行国际跨语言交流,为行业乃至整个社会发展贡献一份力量。”
好文章,需要你的鼓励
谷歌地图将集成Gemini人工智能技术,旨在将其升级为一个"全知型副驾驶"助手。这一整合将大幅提升地图服务的智能化水平,为用户提供更加个性化和全面的导航体验。通过AI技术的加持,谷歌地图有望在路线规划、地点推荐和实时信息服务等方面实现重大突破。
这项由圣母大学和IBM研究院联合开展的研究,开发出了名为DeepEvolve的AI科学助手系统,能够像人类科学家一样进行深度文献研究并将创新想法转化为可执行的算法程序。该系统突破了传统AI要么只能改进算法但缺乏创新、要么只能提出想法但无法实现的局限,在化学、生物学、数学等九个科学领域的测试中都实现了显著的算法性能提升,为AI辅助科学发现开辟了新的道路。
微软研究人员发布新的仿真环境来测试AI智能体,研究显示当前智能体模型容易受到操纵。该名为"Magentic Marketplace"的合成平台让客户智能体与商家智能体进行交互实验。测试包括GPT-4o、GPT-5和Gemini-2.5-Flash等模型,发现智能体在面临过多选择时效率下降,且在协作方面表现不佳。研究揭示了AI智能体在无监督环境下的性能问题。
卡内基梅隆大学研究团队通过3331次大规模实验,系统揭示了代码训练如何提升AI推理能力。研究发现,代码的结构特性比语义内容更重要,适当的抽象形式(如伪代码)可以达到与原始代码相同的效果。不同编程语言产生差异化影响:低抽象语言有利于数学推理,Python更适合自然语言任务。这些发现为AI训练数据的科学化设计提供了重要指导。