Skip to main content
HiNoter
首页/Audio Transcript/如何将音频翻译成文本:转录与翻译
Audio TranscriptSep 14, 202620 min read

如何将音频翻译成文本:转录与翻译

要将音频翻译成文本,首先将语音转录为其原始语言,然后将审核后的转录内容翻译成读者的语言。同语言的语音转文本只需要转录。跨语言处理则需要两个阶段,并且在分享文本前检查语言、说话人、姓名、数字、术语和时间戳。

通过在双语工作流中将转录与翻译分开,把音频翻译成文本
可靠的流程会在录音与翻译之间保留可见的源语言转录稿。

转录与翻译有什么区别?

转录 将口语以同一种语言表示为书面文本。 翻译 则用另一种语言表达该文本的含义。将英语录音转换为英语文字属于转录。将巴西葡萄牙语录音转换为英语文字则需要转录和翻译。

应根据输出语言而不是上传按钮来命名任务。
输入所需输出操作审核依据
英语语音英语文本转录音频 + 英语转录稿
巴西葡萄牙语语音葡萄牙语文本转录音频 + 葡萄牙语转录稿
巴西葡萄牙语语音英语文本转录,然后翻译音频 + 葡萄牙语转录稿 + 英语翻译
葡萄牙语和西班牙语混合语音英语文本分段多语言音频转录,然后翻译音频 + 每段语言 + 源文本 + 英语文本

音频转文本翻译器 可能会用一个按钮隐藏这两个阶段。这样很方便,但最终的英语句子无法显示系统是误听了源语音,还是误译了正确的源文本。只要事实很重要,就应保留源语言转录稿。

将音频翻译成文本的定义,展示转录与翻译的区别
转录改变媒介。翻译改变语言。

将音频翻译成文本最快且可靠的方法是什么?

最快且经得起审查的工作流不是先翻译。先创建可见的源语言转录稿,修正其中的高风险事实,再翻译修正后的版本。对于随意听取内容,直接语音翻译模式可能更快。对于客户记录、访谈、研究笔记或会议决策,先处理源文本的方法更容易审计。

如果你的目标是在一次处理中转录并翻译音频,请将两种输出分开:先批准源语言转录稿,再批准目标语言文本。一个界面可以运行这两项操作,而不必将它们变成一个没有证据支持的结果。

  1. 明确输出内容。 确定读者需要同语言文本、另一种语言,还是双语记录。
  2. 确认源语言和地区设置。 如果已知,请手动选择语言;否则提供一个范围狭窄且合理的候选集。
  3. 创建源语言转录稿。 在有用的情况下保留时间戳、说话人标签、非语音事件和不确定片段。
  4. 修正源文本。 对照音频检查姓名、组织、数字、日期、单位、否定、义务、缩略词和重叠语音。
  5. 翻译审核后的转录稿。 在术语表中锁定已批准的术语,并保留不确定性,而不是编造流畅的措辞。
  6. 执行双语质量检查。 在分享前,逐条对照录音、源语言转录稿和翻译,检查每一项重要陈述。

可以: 自动完成初步处理并减少听取时间。 不能: 推断被重叠语音掩盖的内容、恢复被截断的姓名,或证明自动选择的语言是正确的。

如何将英语音频转换为英语文本?

将英语音频转换为英语文本是转录任务,而不是翻译任务。上传或录制经过授权的音频,如果已知则选择适当的英语地区设置,生成转录稿,并对照录音进行审核。只有当有人需要另一种语言的结果时,才添加翻译阶段。

受控英语输入

已知脚本
奥罗拉客户评审从周四下午 2:00 开始。
玛雅会在中午前发送修订后的报价,
支持 SLA 仍为四小时。

可分享的转录稿可能会添加说话人和时间参考:

[00:00] 玛雅:奥罗拉客户评审从周四下午 2:00 开始。
[00:05] 玛雅:我会在中午前发送修订后的报价,支持 SLA 仍为四小时。

输入条件: 受控的编辑脚本。 输出规则: 规范标点、一位已命名说话人、句子级时间戳。 限制: 本文未合成或提交音频至 ASR 系统,因此这是格式参考,而非实测转录。准确性:不适用。

英语音频到英语文本的转录工作流程
同语言文本在转录和源文本审查后结束。

如何将葡萄牙语音频翻译成英语文本?

要将葡萄牙语的音频翻译成英语文本,首先选择正确的葡萄牙语区域设置,生成葡萄牙语转录稿,根据录音进行校正,然后将审查后的转录稿翻译成英语。当服务提供这些选项时,巴西葡萄牙语使用 pt-BR,葡萄牙葡萄牙语使用 pt-PT

Google Cloud 当前的支持语言文档分别列出了 pt-BR 和 pt-PT,以及包括 es-ES 和 es-US 在内的西班牙语区域设置。功能可用性因模型和区域设置而异,因此列表中的语言代码并不能证明每种配置都具有相同的说话人区分、标点、适配能力或准确性。来源:Google Cloud Speech-to-Text 支持的语言,核查于 2026 年 8 月 11 日。

三列表格的受控示例。文本已预先确定;未运行 ASR 服务。
源音频 / 已知脚本葡萄牙语转录稿英语参考译文
Aurora 项目与客户的会议于周四下午两点开始。Marina 将在中午之前发送修订后的报价,支持 SLA 仍为四小时。[00:00] Marina:Aurora 项目与客户的会议于周四下午两点开始。

[00:07] Marina:我将在中午之前发送修订后的报价,支持 SLA 仍为四小时。
Aurora 项目与客户的会议于周四下午 2:00 开始。

Marina 将在中午之前发送修订后的报价,支持 SLA 仍为四小时。

输入条件: 匿名的受控巴西葡萄牙语脚本。 转录规则: 保留姓名、时间、SLA 和一位说话人。 翻译规则: 使用自然的商务英语,不改变承诺。 限制: 参考译文为编辑版本,未经认证;自动 ASR 运行、专业翻译审查和 HiNoter 运行均不适用。

首要 QA 目标不是文体。请核对 Aurora、 Marina、周四、下午 2:00、中午之前和四小时。即使译文流畅,只要有一个数字错误,仍然是不正确的。

三列表格中的葡萄牙语音频转录和英语翻译示例
三列记录让审查人员能够确定错误是始于识别还是翻译。

AI 能自动检测所说的语言吗?

可以,但自动语言检测是一种受约束的预测,并非无条件的保证。Microsoft 的语言识别文档称,其系统会将音频与候选列表进行比较,支持在开始时识别中最多四个候选语言,以及在连续识别中最多十个候选语言;即使真实语言不在列表中,也会返回一个候选语言。

同一文档称,开始时识别使用开头几秒的音频,连续识别检测片段之间的变化,而不支持同一句话中的语言变化。检测还会增加初始延迟。 来源:Microsoft Azure Speech 语言识别,核查于 2026 年 8 月 11 日。

条件可能出现的问题实际控制措施
正式讨论前的五秒问候开场语言可能控制路由跳过或分离介绍;核实第一个实质性片段
候选语言中未包含巴西葡萄牙语系统仍会选择一个可用候选项包含合理的语言区域设置,或手动选择该语言
包含英语产品术语的葡萄牙语句子句内语言切换可能处理不当将产品术语保存在术语表中,并复核该时间戳
使用不同语言的说话人互相重叠语言和说话人边界可能会合并标记重叠,在可用时分别重放各声道,并指定审核人员
短促、嘈杂或带口音的音频片段可能缺乏足够的清晰证据设置已知语言区域,并在扩大规模前改善源音频
多语言音频转录中的自动语言检测局限
检测标签应该引导工作流程,而不应结束审核。

应如何处理说话人、重叠、口音和语言切换?

说话人分离用于区分声音;说话人识别则将真实身份分配给声音。系统可以正确区分说话人 1 和说话人 2,却仍然附加错误的姓名。请根据自我介绍、议程背景或经授权的参与者确认身份,不要根据声音推断敏感属性。

问题转录标注翻译规则限制
未知说话人说话人 2  未知说话人保留中性标签不要猜测姓名
重叠[重叠语音] 并附带时间范围仅翻译可听清的语音可能无法还原两个完整句子
口音或地区用语准确时使用口语形式为受众选择预期含义语言区域和审核人员仍然很重要
语言切换如有帮助,标记切换语言的短语遵循批准的术语表,或保持品牌术语不变句内检测可能失败
音频不清晰[听不清 00:31]保留不确定性不要编造流畅的文本

对于字幕,带时间的提示在文字和媒体之间提供了稳定的连接。W3C WebVTT 定义了一种带有提示和负载文本的定时文本格式,这在译文必须能够在视频或音频播放中导航时非常有用。 来源: W3C WebVTT 规范,查阅于 2026 年 8 月 11 日。

如何在翻译前建立术语表?

术语表可以防止源转录文本和译文各自偏离。先从名称和不可协商的事实入手,而不是从一本冗长的词典开始。为每个术语提供源形式、批准的目标形式、不得翻译的说明,以及一个上下文示例。

源术语批准的英文规则上下文
AuroraAurora不要翻译项目名称
修订后的报价修订后的报价在销售语境中使用“报价”,不要使用“预算”客户定价文件
支持服务级别协议支持 SLA保留缩写响应承诺
中午中午保留当地日期和时区上下文交付截止时间
  1. 提取参与者姓名、组织、产品、缩写、金额、单位和重复出现的短语。
  2. 请主题负责人在翻译完整文件之前批准有歧义的目标术语。
  3. 先将术语表应用于源转录文本,再应用于译文。
  4. 搜索最终输出,查找变体、未翻译片段和禁止的替换。

如何验证多语言音频转录和翻译?

审查风险,而不是对每一行一视同仁。非正式的内部摘要可能只需要抽查。客户承诺、医疗或法律材料、研究引文、财务数字和已发布的字幕,都需要根据组织的政策由合格人员进行人工审查。

  1. 音频到源文本检查: 将每个姓名、数字、日期、单位、否定表达、义务表达和不确定片段与录音进行比较。
  2. 说话人检查: 在准确的时间戳处核实身份变化,并如实标记重叠说话或未知说话人。
  3. 源文本到目标文本检查: 确认含义、语气、情态和不确定性在翻译中得到保留。
  4. 术语表检查: 在两个版本中搜索产品名称、缩写、批准的术语和地区变体。
  5. 回查: 让双语审阅者检查高风险陈述,不要只依赖流畅的摘要。
  6. 播放检查: 从共享成果中打开选定的时间戳,并确认它们能够到达相应的音频。

停止条件: 如果源音频被截断、听不清或被同时说话严重干扰,请将该段标记为未解决。翻译可以澄清已知含义,但无法恢复录音从未捕获的证据。

音频转录和翻译工作流程的质量检查清单
昂贵的错误集中在身份、术语、日期、金额、义务和否定表达上。

多语言团队应共享哪种输出格式?

团队需求最佳输出保持可见不要单独依赖
快速内部理解目标语言摘要链接到源转录文本和时间参考没有证据支持的摘要
客户交接双语决策和行动负责人、截止日期、源引文、时间戳原始转录文本
研究访谈并排显示的转录文本和翻译说话人标签、不确定内容、行号或时间参考流畅的释义
已发布视频经过审核的字幕时间码和语言标签无时间码的文档
可搜索知识库结构化笔记加源记录语言元数据和引用脱离来源的复制文本

源转录文本是审计层。翻译后的摘要是阅读层。对两者都实施访问控制,记录批准者,并让目标语言笔记指回原始时间参考。

HiNoter 在此工作流程中能做什么?

HiNoter 是一款 AI 会议和多来源笔记工具,可将获得授权的会议、YouTube 视频、PDF、视频和音频转换为结构化笔记和带引用的答案。 在此工作流程中,其公开页面介绍了音频录制或上传、自动语言检测、多语言转录、带说话人标签的转录文本、时间戳、结构化笔记、首选语言摘要,以及基于转录文本的 AI 聊天

公开的 多语言支持页面 还表示,HiNoter 可以将转录文本翻译成不同语言。不过,经过检查的公开页面使用了不一致的语言数量说法:页面标题文本称为 120+,正文称为 100+,功能卡片称为 50+。本文未完成登录后的多语言运行。因此,确切数量、源语言到目标语言矩阵、自动检测行为、完整转录文本翻译输出、处理时间、导出功能和套餐限制,在当前产品中验证之前均为 不适用

受控发布工作流程

  1. 仅上传你获授权处理的会议或音频文件。
  2. 接受较长转录文本之前,检查检测到的源语言和区域设置。
  3. 检查说话人标签、时间戳、术语表术语、数字和不确定段落。
  4. 仅在源转录文本得到纠正后,才生成或请求目标语言的结构化笔记。
  5. 使用 AI 聊天提出具体问题,然后在分享答案之前打开引用的来源和时间参考。
  6. 通过经批准的团队工作流程导出或分发经过审核的笔记。

根据当前公开页面可以做到: 将获得授权的音频转换为带说话人标签的文本和结构化、可搜索的笔记,并支持多语言工作流程。 本文无法确认: 确切的语言覆盖范围、准确性、完整翻译行为、引用粒度、处理速度或特定账户限制。

HiNoter 将音频转换为文本并创建多语言结构化笔记的工作流程
产品声明已在公开页面上进行核查。登录后的工作流程仍是发布前的验证项目。

下一步: 了解以来源为先的工作流程后,在 HiNoter 中处理一个获授权的会议或音频文件。在使用结果之前,根据原始录音核实转录文本、说话人标签、语言处理、结构化笔记和带引用的答案。

有哪些隐私和权限限制?

同意和录音法律因地点和情境而异。在录音、上传、转录、翻译或分享语音之前,取得所需授权。仅向需要源音频和经过审核文本的人员授予访问权限,并在测试新服务之前删除不必要的个人或机密内容。

上传之前,请检查运营方和子处理方、存储位置、国际传输、保留和删除、模型训练用途、人工审核、共享默认设置、账户删除以及导出控制。HiNoter 当前的 隐私政策 讨论了音频或视频上传、国际存储和传输、访问控制、数据权利、保留因素以及账户删除流程。政策还表示,无法保证互联网传输 100% 安全。请阅读当前政策和您所在组织的规定,不要将本段内容视为合规批准。 来源核查于 2026 年 8 月 11 日;政策显示的生效日期为 2025 年 6 月 23 日。

常见问题

音频转录和翻译有什么区别?

转录是将语音转换为同一种语言的书面文本。翻译是将一种语言中的含义转换为另一种语言。将英语语音转换为英语文本只需要转录;将葡萄牙语语音转换为英语文本通常需要先生成葡萄牙语转录文本,再进行英语翻译。

AI 能自动检测语音所使用的语言吗?

可以,一些系统能够从候选语言集中选择一种语言,但在短片段、噪声、口音、语码转换以及候选集中未包含的语言等情况下,检测可能会失败。已知语言区域时,请手动确认,并在处理长文件之前核对最初的片段。

如何将音频翻译成英语文本?

确定所说的语言,创建并校正源语言转录文本,将审核后的文本翻译成英语,然后将姓名、数字、日期、否定表达和术语与音频进行比对。对于较短且风险较低的片段,一个工具可能会完成这两个阶段,但审核仍应按照相同顺序进行。

应该先转录音频再翻译吗?

通常应该。可见的源语言转录文本可以将识别错误与翻译错误区分开来,支持时间戳和说话人标签,并为审核人员提供可用于纠正的依据。直接进行语音翻译可能有助于实时理解,但当输出有误时,其诊断控制能力较弱。

应如何处理巴西葡萄牙语和葡萄牙葡萄牙语?

如果系统支持此选项,请将它们视为不同的语言区域。巴西葡萄牙语请选择 pt-BR ,葡萄牙葡萄牙语请选择 pt-PT,然后使用针对特定语言区域的术语表和审核人员。不要假设通用葡萄牙语设置能够保留发音、词汇、姓名或首选措辞。

HiNoter 在此工作流中做什么?

HiNoter 的公开页面介绍了音频上传或录音、自动语言检测、多语言转录、说话人标签、时间戳、结构化笔记、首选语言摘要以及基于转录文本的 AI Chat。本文尚未完成一次登录后的多语言运行,因此在验证之前,确切的语言覆盖范围、完整翻译行为、导出功能和套餐限制仍为 N/A。