Skip to main content
HiNoter
首頁/AI Translator/轉錄中的說話者標籤與時間戳:最佳實務
AI TranslatorAug 5, 202622 min read

轉錄中的說話者標籤與時間戳:最佳實務

說話者標籤與時間戳可讓逐字稿具備可搜尋性、可歸屬性,也更容易驗證;但前提是格式必須符合交付用途。對已知參與者使用經核實的姓名,當不需要辨識身分時使用角色標籤,只有聲音需要區分時使用穩定的匿名標籤,而無法確認身分時則使用「Unknown speaker」。若要提升可讀性,請在每次說話者切換時加上時間戳;若用於編輯或證據,請使用起訖區間;若用於字幕,則使用提示區間。本指南將定義這些術語、比較格式、處理重疊發言,並提供可重複執行的人工 QA 工作流程。

直接答案: 說話者標籤用來辨識每一次發言,而時間戳則把該發言連結到來源中的某個時點。最可靠、速度最快的預設做法,是「經核實的姓名」或「穩定的角色標籤」加上「發言起始時間戳」,例如 [00:09] Maya Chen:。編輯時使用區間,字幕使用提示時間,無法確認身分時請使用 Unknown speaker,而不是猜測。

定義: 說話者標籤與時間戳是逐字稿中用來標註說話內容的中繼資料,將語音歸屬於一致的人或角色,並把文字、發言區段或字幕提示與來源音訊中的精確位置連結起來。

逐字稿中的說話者標籤與時間戳,含經核實姓名與時間參照
原創編輯示意圖,呈現標籤、時間參照與來源驗證;非產品截圖。

什麼是說話者標籤與時間戳?

說話者標籤與時間戳解答的是兩個不同問題:負責這段內容,以及這段內容在來源中出現於哪裡。有用的逐字稿會將這兩個問題分開,因為系統可能準確地定位並分離聲音,卻仍將真實姓名標錯。

逐字轉錄核心定義,2026-08-05 審閱
術語簡短定義可建立的內容無法單獨建立的內容
說話者分離依聲音將音訊切分,並為各說話輪次指派一致的生成標籤。相對於其他偵測到的聲音,誰在何時說話。此人的經核實姓名、角色、權威或意圖。
說話者辨識將偵測到的聲音對應到經核實的真人或專案角色。可由名單、介紹或已知錄音支持的人類可讀標籤。當聲音重疊或證據不清楚時,無法保證完美歸屬。
時間戳區間針對單詞、發言、片段或字幕提示的起訖時間。與文字相關聯的來源時間窗。文字或說話者標籤是否正確。
事件標記對有意義的聲音或來源狀態使用一致記法,例如 [laughter]、[door closes]、[overlapping speech] 或 [inaudible 00:24]。口語本身無法捕捉的背景資訊。聽不到的字詞或未經核實的身分。

Google Cloud 將說話者分離描述為偵測說話者變化並為不同聲音指派標籤。IBM 的文件進一步說明:生成的 ID 可能不是連續編號,臨時 ID 可能會變動,同一個標籤在沒有其他證據來源之前,不應被解讀為經核實的姓名。

來源:Google Cloud:偵測不同說話者,以及 IBM Cloud:說話者標籤,2026-08-05 審閱。

說話者標籤與時間戳的定義,涵蓋分離、辨識、時間對齊與事件標記
說話者分離、辨識、時間對齊與事件記法是彼此分離的層次。

逐字稿中正確的說話者標籤是什麼?

正確的說話者標籤,是依證據所支持、且從頭到尾一致使用的最具體歸屬方式。外觀樣式是次要的;標籤必須幫助預定讀者區分各次發言,而不誇大確定性。

說話者標籤決策表
可用證據建議標籤範例驗證規則
身分已確認且與內容相關已驗證的全名Maya Chen:比對自我介紹、核准名單,或已知的參考聲音。
角色比名字更重要固定角色Interviewer:確認角色,並在全文中使用相同拼法。
聲音已分開但身分未知匿名識別碼Speaker 2:保持對應關係穩定;不要假設數字代表時間順序。
無法確認身分明確的不確定性Unknown speaker:在音訊或專案紀錄支持更正之前,先維持未知狀態。

可以: 在聲音經確認後,將匿名標籤重新命名。 不可以: 把分離說話者辨識的編號、顯示順序、口音、他人提到的職稱,或聽起來可能是同一人的聲音,當作身分證明。

在字幕中,視覺位置有時可辨識畫面中的說話者,而不必重複姓名。DCMP 建議清楚標示說話者並維持一致的呈現方式;它也指出,作為說話者 ID 的專有名詞應大寫,而一般性識別通常用小寫。純文字逐字稿可以使用一般姓名大小寫,後接冒號。

來源: DCMP Captioning Key,於 2026-08-05 審閱。

使用已驗證姓名、角色、Speaker 2 或 Unknown speaker 的正確說話者標籤格式
當證據薄弱時,沿著精確度階梯往下調;絕不要靠猜測往上調。

哪一種說話者標籤格式是正確的?

沒有通用的說話者標籤格式。正確格式是目的端要求且一致套用的格式。文件可使用易讀的輪次標籤,WebVTT 可使用機器可讀的聲音註記,而當法院、廣播機構、研究計畫、無障礙供應商或典藏單位另有規範時,則應採用客戶指定的精確樣式。

依交付物分類的說話者標籤格式
交付物建議模式範例主要限制
可讀的逐字稿時間戳 + 已驗證標籤 + 冒號[00:09] Maya Chen: The pilot starts September 22.不是字幕檔,也不是逐字級對齊。
以角色為基礎的訪談固定角色 + 冒號Interviewer: What changed?若研究設計要求具名歸屬,則可能無法隱藏身分。
匿名研究逐字稿參與者代碼P03: The handoff was unclear.該代碼必須與個人身分分開管理。
WebVTT 字幕提示區間 + 聲音範圍<v Maya Chen>The pilot starts September 22.播放器支援與字幕定位規則仍然重要。

避免在同一位說話者上,於 MayaM. ChenSpeaker 1Manager 之間切換。若在審閱中途更正了身分,請更新所有前文的發言,並重新檢查任何根據舊標籤生成的摘要、待辦事項、引文或答案。

逐字稿中的時間參照應該出現在哪裡?

對於多說話者、且可讀的逐字稿,最快且實用的預設做法,是在每次輪替前立即放上輪次起始時間戳。這樣審閱者每次換人只要點一下或拖曳一次即可,不必在每句話都塞入時間資料。只有當下一個任務需要更細的標示時,才選擇其他層級。

依任務而定的時間戳粒度
時間參照類型範例最適合取捨
章節或段落00:15:00 採購風險Podcast、講座或長會議導覽粒度太粗,不適合引文驗證。
輪次起點[00:02:14] Maya Chen:可讀性高的訪談與會議逐字稿無法顯示精確結束時間。
輪次區間[00:02:14-00:02:19]編輯、證據審查與重疊輪次視覺雜訊較多。
字幕提示區間00:02:14.000 --> 00:02:19.000WebVTT 顯示時間需要有效的 cue 語法與可讀的切分。
字級偏移"pilot" 134.2s-134.7s對齊、搜尋與自動化 QA通常不適合直接作為可見正文。

Google Cloud 會為辨識出的單字提供起訖偏移量。W3C WebVTT 將 cue 定義為與音訊或影片對齊的時間區間,並使用小數點表示毫秒,例如 00:11.000 --> 00:13.000。逐字稿中的方括號是一種編輯慣例,並非 WebVTT 的要求。

可以: 儲存字級時間資訊,同時只顯示輪次級時間戳。 不可以: 因為時間資訊更細,就假設辨識或歸屬一定正確。

來源: Google Cloud:字詞時間偏移量 與 W3C WebVTT,審閱於 2026-08-05。

逐字稿中的時間參照:輪次起點、區間、字幕提示與字詞時間戳
時間戳粒度應依下一步動作而定:導覽、審閱、字幕顯示或機器對齊。

完整逐字稿、智慧逐字稿與字幕有何不同?

同一段原始音訊可以產生三種有效輸出,因為每種格式的用途不同。完整逐字稿保留說話特徵,智慧逐字稿在保留意義與歸屬的前提下提升可讀性,而字幕則將文字切分成可同步顯示的單位。

受控編輯來源樣本: 在 00:09.100,Maya 說:「嗯,所以我、我覺得試點會在 9 月 22 日開始。」在 00:11.500,Luis 重疊說:「待採購核准。」在 00:13.300,Maya 說:「對。」這是構造出的 QA 樣本,不是登入產品的測試資料。

完整逐字稿

[00:09.100-00:12.700] Maya: 嗯,所以我、我覺得試點會在 9 月 22 日開始。
[00:11.500-00:13.200] Luis: [重疊發言] 待採購核准。
[00:13.300-00:13.800] Maya: 對。

當重複、填充詞、停頓、中斷與輪次競爭是分析或專案規格的一部分時,就使用這種層級。每一種標記都要在樣式表中定義清楚。

智慧逐字稿

[00:09] Maya: 我覺得試點會在 9 月 22 日開始。
[00:11] Luis: [重疊發言] 待採購核准。
[00:13] Maya: 對。

這個版本會移除不流暢語,但不會把 Luis 的條件併入 Maya 的句子中。清理語言時,不可改變陳述的歸屬。

WebVTT 字幕範例

WEBVTT

00:09.100 --> 00:12.700
<v Maya>我覺得試點會在 9 月 22 日開始。

00:11.500 --> 00:13.200
<v Luis>待採購核准。

00:13.300 --> 00:13.800
<v Maya>對。

WebVTT 使用起訖 cue 時間,並支援 voice span。字幕製作也必須考慮閱讀速度、換行、版面位置與同步 cue。DCMP 建議同步性、內容一致性、說話者識別與有意義的聲音資訊;FCC 的電視字幕規則則使用四個審查原則:準確、同步、完整與適當放置。

來源: W3C WebVTT、DCMP Captioning Key 與 47 CFR 79.1,審閱於 2026-08-05。CFR 的字幕品質規則適用於其定義的電視情境;本文將這四個品質詞作為審查標準,而非普遍的法律主張。

完整逐字稿、智慧逐字稿與 WebVTT 字幕的說話者標籤與時間戳範例
應依輸出目的格式化同一份來源,而不是套用單一通用範本。

應如何處理重疊、未知說話者與事件標記?

重疊同時是逐字稿問題,也是歸屬問題。如果兩個聲音都清晰可辨,就以互相交疊的區間保留兩段輪次。如果只有一個聲音清楚可辨,就轉寫那個聲音,並且只在有助於讀者理解時標註該狀況。如果兩者都不可靠,就把來源標記為聽不清,並在 QA 時回頭檢查。

  • 重疊但可辨識的發言: 保留分開的標籤與時間區間;不要把兩位說話者合併成同一句。
  • 簡短回應詞: 仔細核對 "yes," "right," 和 "mm-hmm",因為說話者分離常會誤配短促發言。
  • 身份未知: 使用 Unknown speaker: 或穩定的匿名 ID,而不是推測可能的人名。
  • 詞句不清: 使用專案定義的標記,例如 [inaudible 00:24];絕不要寫成審核者預期聽到的字詞。
  • 有意義的聲響: 在影響理解時,使用簡潔的小寫描述,例如 [laughter]、 [door closes] 或 [phone rings]
  • 沉默與停頓: 只有在持續時間或對對話有影響時才標註。

IBM 警告,在混合音訊中,交叉對話或重疊可能很難甚至無法被準確辨識;而短語句、雜訊、主導型說話者以及大量參與者,也都會降低說話者標籤的表現。分離的錄音通道可以減少推斷說話者身分的需要,但各通道仍需對齊與 QA。

自動說話者識別的限制是什麼?

自動系統可以加速切分與來源導覽,但說話者分離輸出只是暫定中繼資料。應把它視為待審核清單,而不是最終的身分紀錄。

自動說話者標籤的失敗模式
失敗類型成因可見症狀審核者動作
說話者錯換聲音相似或銜接不順某人的句子出現在另一個標籤下在切換前後重播,並修正整段受影響內容。
幻影說話者雜訊或聲音變化即使沒有新的人加入,也出現新的標籤只有在確認該聲音與附近發言一致後,才合併標籤。
漏辨說話者發言很短或主要說話者過於主導短暫參與者被分配到主要聲音人工審查插話與回應詞。
重疊塌縮單一混合通道兩個聲音變成一句破碎的句子可用區間播放或分離音軌時就使用。
暫存標籤漂移模型會隨著更多音訊到來而修正估計部分輸出與最終輸出的說話者編號不同先在最終逐字稿上進行身分對應,再統一標準化。

可以: 利用說話者分離來優先處理說話者切換的審查。 不可以: 在未聽原始音訊的情況下,保證每個聲音、插話或人名都正確。

如何對說話者標籤與時間戳進行人工 QA?

先從高風險內容開始,而不是線性重播整個檔案:決策、義務、人名、日期、數字、引述、對外承諾,以及聲音重疊的地方。接著再將整份文件標準化。

  1. 準備名單與風格。 列出預期說話者、核准名稱或角色、輸出格式、時間戳粒度、事件標記慣例與隱私限制。
  2. 錨定已知聲音。 使用自我介紹或其他已驗證的來源片段,將聲音連結到真實姓名;不要根據分離編號推斷身分。
  3. 審查說話者切換。 重播第一次轉接,以及每個高風險的決策、引述、負責人、截止日、簡短回應與插話。
  4. 處理重疊與不確定性。 保留可辨識的同時發言,對有用的重疊或聲音事件一致地加標記;若證據不足,保留 Unknown speaker 或 inaudible 標記。
  5. 檢查時間戳對齊。 確認發言開始或區間時間戳對應正確的原始片段,且字幕提示的開始、結束與閱讀順序都與音訊一致。
  6. 標準化文件。 整份交付物統一使用同一套標籤拼寫、大小寫、標點、時間戳格式與事件標記風格。
  7. 重新檢查衍生輸出。 修正標籤或時間後,驗證摘要、待辦事項、引述、匯出內容與引用答案,確保錯誤不會沿著下游保留下來。

最具防禦力的快速流程: 使用穩定的自動產生標籤與發言起始時間戳,驗證每個聲音的介紹或第一段清晰樣本,審查所有高影響的轉接,然後全域重新命名標籤。若交付物風險很高,應使用第二位審查者或有紀錄的抽樣規則,而不是假設第一次檢查就已完整。

Measured: 已於 2026-08-05 檢視 Google 與 Bing SERP,以及 Google Cloud、IBM Cloud、W3C、DCMP 和 FCC 頁面。 N/A: 音訊上傳、說話者分離輸出、產品準確度、審查者一致性、處理速度,以及登入後功能可用性。

用於正確處理說話者標籤、時間戳、重疊與未知說話者的人工作業流程
在潤飾每一行之前,先驗證身分與高風險原始片段。

說話者標籤、時間戳與引用如何相互驗證?

當標籤、來源時間與衍生答案能被視為同一條鏈來檢查時,逐字稿才算是以來源為基礎。即使已更正文稿,如果行動項目或 AI 答案仍保留舊的負責人,修正就還不夠。

受控編輯示範;產品測量 N/A。

00:09 Maya Chen: "The pilot starts September 22."
00:24 Speaker 2: "I will send the access list by September 15."
00:41 Maya Chen: "Procurement approval is still open."

審查流程: 開啟 00:24,將聲音與 Luis Ortiz 的已驗證自我介紹比對,把 Speaker 2 改成 Luis Ortiz,然後重新執行或重新檢查所有衍生輸出。

更正後的行動項目: Luis Ortiz - 送出存取清單 - 截止日期 9 月 15 日 - 來源 00:24。

引用答案: 「誰擁有存取清單?」Luis Ortiz [00:24]。

只有當逐字稿、摘要、行動項目、匯出內容和引用答案都使用 Luis 時,更正才算完成。如果無法驗證身分,誠實的答案是 Speaker 2 負責該行動,來源 00:24,待確認身分。

HiNoter 在這個工作流程中扮演什麼角色?

HiNoter 是一款 AI 會議與多來源筆記工具,可將已授權的會議、YouTube 影片、PDF、影片與音訊轉換為結構化筆記與附引用的答案。

在會議或檔案獲得處理授權後,可評估 HiNoter 是否支援帶講者標籤的逐字稿導覽、時間戳播放、更正標籤、結構化摘要、行動項目,以及可回連至來源片段的 AI Chat 答案。來源連結讓更正可被檢查;但這並不代表原始自動標籤絕對正確無誤。

使用者提供/發布前請驗證: 講者標籤編輯、時間戳導覽、自動出席判定、逐字稿產生、處理速度、語言支援、結構化筆記、整合功能,以及可連結來源的 AI Chat,皆未在本頁的已登入 HiNoter 帳戶中測試。請在發布前確認目前行為、帳戶方案、匯出格式、隱私控制、來源存取、更正傳遞與刪除選項。

請造訪 HiNoter,測試 音訊轉文字工作流程,比較 AI 會議筆記,檢視 AI Chat 的來源引用,查看 隱私權政策,並參閱 Google Docs 整合。相關的 多語言逐字稿工作流程 說明了為什麼講者歸屬與跨語言語意是兩個不同的品質檢查。

HiNoter 講者標籤、時間戳更正與來源引用的 AI Chat 工作流程
以來源為依據的工作流程可讓審閱者將標籤更正追溯到最終答案。

需要哪些隱私與權限檢查?

講者標籤可能會將一般逐字稿轉變為個人資料,因為它把聲音、姓名、角色、發言內容與時間連結起來。請只處理您擁有或已獲授權使用的音訊,在需要時通知參與者,並將逐字稿與來源錄音的存取範圍限制給需要的人。

  • 記錄錄音、轉錄、講者識別與下游 AI 處理的目的。
  • 當研究或隱私設計需要去識別化時,使用參與者代碼而非姓名。
  • 不要從聲音推斷敏感的身分特徵。
  • 限制可將匿名參與者代碼對應到真實姓名的名單存取權。
  • 對逐字稿與底層音訊都套用保存與刪除規則。
  • 若內容涉及法律、人資、醫療、客服或受監管資料,應聯繫負責的隱私或合規所有人。

這是一份工作流程指南,並非法律建議。實際參與者、司法管轄區與使用情境必須檢視產品隱私條款與當地錄音或生物特徵規則。

常見問題

逐字稿中的講者標籤是什麼?

逐字稿中的講者標籤用來識別發言輪次所屬的人、角色或匿名聲音。例子包括 Maya Chen、訪談者、Speaker 2,以及 Unknown speaker。標籤應保持一致,且除非身分已從來源或專案紀錄中驗證,否則不應聲稱真實身分。

哪一個講者標籤才是正確的?

正確的講者標籤應是證據所能支持的最具體標籤:當身分重要時使用已驗證姓名;角色已足夠時使用角色名稱;僅在聲紋分離只區分出不同聲音時使用穩定的匿名編號;若無法確認身分,則使用 Unknown speaker。一致性與可驗證性比裝飾性格式更重要。

正確的講者標籤格式是什麼?

為了讓逐字稿易讀,請在每個發言輪次的開頭使用一個標籤加冒號,例如 [00:09] Maya Chen: 計畫將於 9 月 22 日開始。字幕請遵循目標檔案規格;WebVTT 支援 voice span,可標示該提示的講者。客戶、法院、廣播單位或研究專案可能會要求不同的內部風格。

逐字稿中的時間參考應該放在哪裡?

一般逐字稿中,請將發言開始時間戳放在講者標籤之前。當編輯需要精確邊界時使用起訖區間;只有在專案要求時才使用定期時間戳;字幕則使用提示區間。詞級時間最好保留為機器可讀的對齊資料,而不是每個字前都印出來。

重疊發言或未知講者應該如何標示?

當內容仍可理解時,請保留雙方的發言並各自給予時間區間。若有助於審閱者,可加入一致的狀態標記,例如 [overlapping speech]。如果聲音或內容無法驗證,請使用 Unknown speaker 或 [inaudible 00:24],而不是指定一個可能的姓名或憑空編造文字。

HiNoter 如何處理講者標籤與時間戳?

在獲得授權後,可評估 HiNoter 是否支援逐字稿導覽、講者標籤編輯、結構化筆記、行動項目,以及可回到來源時間戳的 AI Chat 答案。這些產品行為是本篇文章的使用者提供資訊,且在發布前必須於目前產品、方案、隱私控制與來源連結工作流程中驗證。

將已授權的逐字稿與其來源比對

請先檢視上方的受控範例。接著在 HiNoter 中處理一段已授權的會議或檔案,更正講者標籤,開啟來源時間戳,並確認摘要、行動項目與 AI Chat 答案都帶有已更正的歸屬。

處理已授權的會議或檔案 | 查看來源連結的 AI Chat