核心工作内容
Audio ML(音频机器学习)岗位负责构建处理声音内容的模型,常见应用包括语音转写(把音频转成文字字幕)、音乐理解(识别曲风、情绪、片段特征)和音频内容分类,为搜索、推荐和内容管理提供支持。
在娱乐场景中的应用
转写能力支撑视频字幕自动生成;音乐理解能力支撑音乐类内容的分类和推荐;音频内容分类能力可以帮助平台识别音频内容中的敏感或违规片段。
需要的能力
需要具备信号处理和机器学习基础,同时理解具体娱乐场景下音频内容的特点(如音乐版权、语音识别在不同口音下的准确率差异)。
与视频AI的关系
Audio ML经常与视频AI团队协作,共同支撑对完整视听内容的理解,比如把视频画面理解和音频转写结合,生成更完整的内容标签体系。