Skip to main content
HiNoter
首頁/Audio Transcript/音訊轉錄範例:原始語音 vs. 乾淨文字
Audio TranscriptAug 10, 202618 min read

音訊轉錄範例:原始語音 vs. 乾淨文字

音訊轉錄範例: 這個將音訊轉文字的轉錄範例使用一段 45 秒的會議片段,展示四種有效輸出:完整逐字稿、乾淨易讀的文字、帶說話者標記與時間戳的逐字稿,以及附來源連結的摘要。要選哪一種版本,取決於你是必須保留精確原話、追蹤說話者、分享可讀對話,還是根據決策採取行動。

原始語音

「呃,好,所以關於 Aurora 上線,我覺得 beta 應該改到 10 月 17 日星期四,不是星期二。」

乾淨文字

「關於 Aurora 上線,beta 應該改到 10 月 17 日星期四,不是星期二。」

定義: 音訊轉錄是將口語音訊轉換成書面文字。成品可能保留每一句話、移除口語贅字、標示說話者、加入時間戳,或濃縮對話,但每一種編輯都必須遵循明確規則,並且可追溯回來源。

逐字稿不是單一固定的東西。你如果只要求「準確文字」,編輯仍需要知道要不要保留 um、把「eighteen thousand five hundred dollars」標準化為 $18,500、把某個聲音標成 Maya,或是把決策整理成摘要。這裡的每一個版本都來自同一段受控重現,所以你可以清楚看到哪些地方改變了,以及為什麼改變。

轉錄音訊轉文字範例,對比原始、乾淨、標註說話者與摘要輸出
這張證明表視覺把每種格式視為編輯決策,而不是不同來源或準確度的噱頭。

什麼是音訊轉錄?

音訊轉錄是把語音轉成文字。來源可以是會議、訪談、講座、播客、語音備忘錄、通話或影片音軌。錄音與逐字稿不可互換:音訊保留聲音與時間資訊;逐字稿讓口語內容可搜尋、可編輯;摘要則只挑出後續任務所需的資訊。

Google Meet 使用 Transcripts 這個詞,並說它的會議逐字稿包含口語內容,不包含聊天訊息。Zoom 則在雲端錄製流程中使用 audio transcripts 。這些平台術語有助於界定成品,但仍必須查看相關官方文件,以確認帳號資格與當前控制選項。

可以: 讓經授權的語音可搜尋、可引用、可審閱。 不可以: 證明說話者身分、把編輯過的摘要變成精確證詞,或讓不清楚的音訊變得確定無疑。

轉錄音訊轉文字範例:一段片段,四種輸出

播放經受控的 45 秒來源

測量:45.013 秒;單聲道;16 位元;22,050 Hz;五次發言;0.55 秒間隔。虛構專案名稱與匿名腳本。參考逐字稿方法:已知腳本,並手動對照輸出的 WAV 檔檢查。

同一來源產生的四種逐字稿格式。「最佳」是指最適合該任務,不是普遍最準確。
格式保留什麼最適合主要限制
完整逐字贅詞、重複、重啟、口語表達證據審查、話語研究、精確語音分析閱讀較慢;仍不是語音細節記譜
乾淨逐字稿意義、決策、名稱、數字、對話順序易讀訪談、內部分享、發布草稿編輯選擇可能抹去有意義的遲疑
標註說話者的逐字稿發言回合、已核實角色、回合起始時間戳會議、訪談、座談、交接說話者分離標籤不等於已驗證身分
附來源連結的摘要決策、行動、負責人、依賴關係、來源時間執行與快速審閱不能取代逐字稿或音訊
單段音訊產生四種輸出的音訊轉錄範例表
格式應該依工作而定:審核語音、閱讀對話、追蹤說話者,或根據結果採取行動。

完整逐字音訊轉錄範例

輸入條件受控的 45.013 秒雙人 WAV 檔。輸出規則保留贅詞、重複、確認語與口語數字形式。限制可讀拼字規範,而非語音記號或重疊分析。[00:00.00] 專案負責人
呃,好,所以關於 Aurora 上線,我覺得 beta 應該改到 10 月 17 日星期四,不是星期二。

[00:10.33] 營運經理
對,不過,呃,採購還需要修訂後的報價。金額是一萬八千五百美元。

[00:21.28] 專案負責人
是的。Maya 會在明天中午 2:00 之前寄出,Luis 會更新上線檢查清單。

[00:29.56] 營運經理
抱歉,確認一下,Maya 負責報價,而 Luis 負責檢查清單,對嗎?

[00:37.57] 專案負責人
沒錯。而且,讓我們、讓我們在法務審閱 Nova 條款之後,把客戶備註分享出去。

編輯說明: 「呃」、「好」、「嗯」以及「讓我們、讓我們」都保留,因為規則是完整逐字。標點是編輯加上的:說話者並沒有把逗號講出來。角色名稱來自受控腳本,不是自動身分辨識。

完整逐字音訊轉錄範例,含贅詞與重複標註
完整逐字會保留語音不流暢處。除非專案規格另有要求,否則不必使用語音字母。

乾淨音訊轉文字範例

輸入條件相同的 WAV 檔與經人工核對的參考文字。輸出規則移除無意義的贅詞;標準化日期、時間與貨幣;保留意義。限制不可悄悄刪去不確定性、否定、所有權或依賴關係。[00:00.00] 專案負責人
關於 Aurora 上線,beta 應該改到 10 月 17 日星期四,不是星期二。

[00:10.33] 營運經理
採購還需要修訂後的 $18,500 報價。

[00:21.28] 專案負責人
Maya 會在明天 2:00 p.m. 之前寄出,Luis 會更新上線檢查清單。

[00:29.56] 營運經理
確認一下,Maya 負責報價,而 Luis 負責檢查清單,對嗎?

[00:37.57] 專案負責人
沒錯。我們在法務審閱 Nova 條款之後分享客戶備註。

有哪些改變: 刪除了贅詞;「October seventeenth」變成「10 月 17 日」;「eighteen thousand five hundred dollars」變成「$18,500」;「two p.m.」變成「2:00 p.m.」。該動作仍然是 不是星期二,而客戶備註仍需等待法務審閱。這些細節帶有意義,不能被潤飾掉。

逐字稿與整理稿音訊轉文字範例,附紅線修訂
乾淨的逐字稿會移除口語雜訊,同時保留決策、限制、責任歸屬與不確定性。

附說話者標記的會議逐字稿範例

INPUT CONDITION五個已知發言輪次,以 0.55 秒的固定間隔分隔。OUTPUT RULE使用已驗證的編輯角色與每一輪的測量開始時間。LIMIT自動辨識說話者可能將聲音分開,但不會知道真實姓名。[00:00.00] 專案負責人
對於 Aurora 上線,Beta 版本改到 10 月 17 日星期四,不是星期二。

[00:10.33] 營運經理
採購仍需要更新後的 18,500 美元報價。

[00:21.28] 專案負責人
Maya 會在明天中午 2:00 前寄出,Luis 會更新上線檢查清單。

[00:29.56] 營運經理
確認一下,報價由 Maya 負責,檢查清單由 Luis 負責嗎?

[00:37.57] 專案負責人
沒錯。等法務審閱 Nova 條款後,我們再分享客戶通知。

Google Cloud 將 說話者區分 描述為偵測不同說話者並指派說話者標籤。這與說話者辨識不同。"Speaker 1" 可以是一群相似語音的聚合;要把它改成 "Project Lead" 需要可靠的脈絡或人工驗證。對於帶時間的文字,W3C 的 WebVTT 規範 使用時間提示並支援 voice spans。這份可讀的會議逐字稿則是每個說話輪次只使用一個測量開始時間。

帶有說話者標籤與測量輪次起始時間戳記的會議逐字稿範例
時間軸顯示每個營運事實是誰說的,以及審閱者應該回到來源的哪個位置。

摘要式轉錄範例

INPUT CONDITION同一份已審閱的會議逐字稿。OUTPUT RULE萃取一項決策、具名動作,以及一項帶來源時間的依賴關係。LIMIT摘要會省略對話證據,不能取代錄音。DECISION
將 Aurora Beta 改到 10 月 17 日星期四,而不是星期二。 [00:00.00]

ACTIONS
- Maya:在明天中午 2:00 前寄出修訂後的 18,500 美元報價。 [00:10.33-00:29.01]
- Luis:更新上線檢查清單。 [00:21.28-00:37.02]

DEPENDENCY
- 只有在法務審閱 Nova 條款之後,才分享客戶通知。 [00:37.57]

這個版本很有用,因為它把長逐字稿中容易混在一起的三種資訊分開:什麼改變了、誰現在負責什麼工作,以及在分享面向客戶的通知之前必須先完成什麼。時間戳不是裝飾性的精確,而是供審閱用的定位標記。讀者可以在引述的發言附近打開音訊,確認該陳述。

逐字轉錄與整理轉錄:編輯應該改什麼?

一致交接的編輯規則。專案專屬的風格指南會覆蓋這些預設。
語音特徵完整逐字整理版檢查問題
填充詞:um、uh、okay保留在沒有意義時移除停頓是否會影響理解?
重複字詞保留:「let's, let's」只保留一次重複是強調,還是說錯開頭?
文法保留口語文法只做輕微整理這個編輯會改變語氣或意思嗎?
日期、時間、貨幣可保留口語形式一致地標準化數字有聽對並且格式正確嗎?
姓名與術語使用已驗證拼寫使用已驗證拼寫拼寫有來源脈絡支持嗎?
聽不清楚的語音標記 [inaudible 00:00]標記或標示供審閱編輯有沒有猜測?
重疊發言標記同時發言若可還原則分離輪次是否仍能安全歸屬責任?

可以: 移除不帶意義的干擾。 不可以: 把「我想」改成確定語氣、刪掉「不」、指定未知說話者,或把一個未定案的提案變成決策。

追蹤編輯: 上方乾淨音訊轉文字範例中的紅線,清楚顯示刪除與標準化。當兩者差異很重要時,正式的逐字稿也應保留其風格指南或編輯歷史。

如何對逐字稿做品質檢查?

  1. 保留單一真實來源。 保留授權音訊、其長度,以及參考逐字稿,讓每個編輯後輸出都能對照同一來源。
  2. 編輯前先決定交付版本。 依照讀者任務與風險,選擇完整逐字、整理版、附說話者標記,或摘要輸出。
  3. 採用書面風格規則。 先決定如何處理填充詞、重複、標點、數字、日期、姓名、時間戳、聽不清楚的語音與重疊發言。
  4. 審查高風險事實。 再聽一次姓名、金額、日期、否定語、任務負責人、決策與依賴關係。
  5. 保留可追溯性。 保留輪次時間戳或來源連結,讓審閱者可以從重要主張回到相關音訊。

第一遍請以正常播放速度收聽,檢查意義與說話流程。接著重播姓名、縮寫、金額、日期、截止期限、否定語與動作負責人周圍的高風險片段。只有在需要時才使用較慢速度;過度放慢可能會扭曲子音。最後,在沒有音訊的情況下閱讀逐字稿,找出標點、分段、標籤不一致,以及不合理的交接。

就這個樣本而言,人工檢查已確認 Aurora、 Nova、 Maya、 Luis、 10 月 17 日、 18,500 美元、 明天中午 2:00、報價負責人、檢查清單負責人,以及法務審閱的依賴關係。「明天」仍然是相對時間,因為這段重現內容沒有建立會議日期。

音訊轉錄範例的人為品質保證檢查清單
複查應聚焦於那些一旦出錯就會改變決策、付款、期限、歸屬或授權的事實。

什麼會影響轉錄準確度?

「音訊轉錄」並不存在可辯護的通用準確率百分比。結果會隨著麥克風距離、房間回音、交談重疊、背景噪音、壓縮、口音、語碼轉換、詞彙、專有名詞、數字密度、說話者相似度,以及所選輸出規則而改變。甚至評分方法也會影響結果:字錯率並不能直接衡量說話者歸屬是否正確、標點是否正確、時間戳精度,或摘要是否保留了決策內容。

風險因素典型失敗實務控制
說話者重疊詞語融合或被歸到錯誤的說話者若可行,使用獨立麥克風/軌道;標記重疊處
專有名詞與術語Aurora 或 Nova 被轉成常見詞提供詞彙表;對照專案資料核實
金額與日期$18,500 變成 $8,500;星期二/星期四互換重播該段並與上下文比對
相似聲線說話者標籤在通話中途切換檢查輪次順序並使用已驗證的參與者背景
過度清理不確定性或依存關係消失對照參考轉錄稿稽核編輯內容

已測量 vs. N/A: WAV 長度與輪次起點已在本地量測。已將已知腳本與渲染後音訊進行人工核對。自動 ASR 準確率、競品準確率,以及登入狀態下的 HiNoter 結果均未量測,因此都維持 N/A。本文不作固定準確率宣稱。

HiNoter 會如何處理同一段音訊?

HiNoter 是一款 AI 會議與多來源筆記工具,可將經授權的會議、YouTube 影片、PDF、影片與音訊轉為結構化筆記與具引用來源的答案。

預期的同來源工作流程是:上傳經授權的 WAV,檢視依說話者分離的文字,將摘要與待辦事項和已審核轉錄稿比對,打開心智圖查看決策與依存關係,接著向 AI Chat 提問,例如「誰負責修訂後的報價?」並沿著其引用回到相關來源片段。請參閱 audio-to-text 功能、 AI Chat、 產品與實體總覽、Privacy Policy,以及 Google Docs 整合。獨立的 About 與 integrations 登陸路由在 2026 年 8 月 10 日回傳 404,因此此處改用可存取的首頁與特定整合頁面。

使用者提供/發佈前需驗證: 依說話者分離的轉錄、自動語言偵測、50+ 語言支援、摘要、待辦事項、心智圖、可引用來源的 AI Chat、匯出、整合、處理速度、方案限制、保留與刪除行為,皆未在登入狀態下的 HiNoter 帳戶中為本草稿量測。請在以 N/A 標示替換前,或在提出產品宣稱前,先驗證目前的 UI 與文件。

可以,但需經驗證: 從經授權音訊繼續產出結構化輸出與具引用來源的問題回答。 不可以: 建立錄音同意、繞過存取規則、保證說話者身分,或免除對關鍵事實的複查。

HiNoter 使用同一段音訊產出轉錄 摘要 待辦事項 心智圖與具引用來源的 AI Chat 工作流程
產品工作流程使用的是同一個受控樣本,而非不相干的宣傳截圖。登入後輸出仍為 N/A。

下載轉錄模板與範例包

在開始轉錄前,使用空白模板先聲明來源、授權、格式、時間戳規則與 QA 流程。範例包包含本頁所示的參考逐字稿、清潔版與摘要版輸出。

常見問題

我應該使用哪種轉錄格式?

當精確語音很重要時,使用完整逐字稿;當需要可讀對話時,使用清潔轉錄;多人會議適合使用標示說話者的文字;而讀者需要決策與行動時,則使用附來源的摘要。對於會產生後果的工作,即使最終交付物是摘要,也應保留音訊與已審核轉錄稿。

逐字轉錄與清潔轉錄有什麼差異?

逐字轉錄依照既定風格指南,保留口語填充詞、重複、修正未完成的句子與非正式文法。清潔轉錄則移除不具意義的口語雜訊並標準化格式,同時保留原意。清潔不代表改寫:編輯不能憑空捏造說話者沒有說出的意圖、確定性或事實。

音訊轉文字範例應包含哪些內容?

有用的音訊轉文字範例應說明來源、長度、錄音條件、轉錄規則、說話者標記方法、時間戳慣例、審核流程與已知限制。它也應讓讀者能將輸出與同一段音訊相比較,而不是把無關文字當作產品準確性的證明。

會議轉錄稿中的說話者標籤與時間戳如何加入?

說話者標籤可能來自聲紋分離、參與者中繼資料或人工辨識,但生成的說話者編號不能證明身分。時間戳可標示每個發言輪次、固定間隔,或字幕提示邊界。分享轉錄稿前,應說明所用慣例,並根據錄音核實姓名與時間。

轉錄稿一定要保留每個填充詞才算準確嗎?

不一定。準確度取決於事先約定的輸出規則。完整逐字交付通常會保留填充詞與重複;清潔版交付則可在不改變意義的情況下刪除它們。兩者都可以符合各自規格而保持準確。問題在於悄悄切換規則,或刪去對解讀有影響的停頓。

HiNoter 能把同一段音訊同時轉成轉錄稿與會議筆記嗎?

使用者提供的產品定位指出,HiNoter 可將經授權的音訊處理成依說話者分離的轉錄、摘要、待辦事項、心智圖,以及具來源連結的 AI Chat 回答。本文章並未在登入帳戶中量測這些輸出,因此在發佈前必須驗證目前行為、語言覆蓋、匯出、限制與隱私控制。

處理一段經授權的錄音並檢查每一項輸出

將一個經授權的會議或音訊檔上傳到 HiNoter,然後在分享結果前,將其轉錄稿、摘要、待辦事項、心智圖與具來源連結的回答,與錄音逐一比對。

處理經授權的音訊檔 | 查看具引用來源的回答流程