Etykiety mówców i znaczniki czasu sprawiają, że transkrypt można przeszukiwać, przypisywać do źródła i łatwiej weryfikować, ale tylko wtedy, gdy format odpowiada docelowemu zastosowaniu. Używaj zweryfikowanych nazw dla znanych uczestników, etykiet ról, gdy tożsamość nie jest potrzebna, stabilnych etykiet anonimowych, gdy wystarczy rozróżnienie głosów, oraz etykiety Unknown speaker, gdy nie da się potwierdzić tożsamości. W czytelnych transkryptach dodawaj znacznik czasu przy każdej zmianie mówcy; używaj interwałów start-end do montażu lub materiału dowodowego oraz interwałów sygnałowych w napisach. Ten przewodnik definiuje pojęcia, porównuje formaty, omawia nakładającą się mowę i przedstawia powtarzalny, ludzki proces kontroli jakości.
Bezpośrednia odpowiedź: Etykiety mówców identyfikują każdą wypowiedź, a znaczniki czasu łączą ją z konkretnym momentem w źródle. Najszybszym, niezawodnym domyślnym rozwiązaniem jest zweryfikowana nazwa lub stabilna etykieta roli plus znacznik czasu na początku wypowiedzi, na przykład [00:09] Maya Chen:. Używaj interwałów do montażu, czasów sygnałowych do napisów oraz Unknown speaker zamiast zgadywać tożsamość.
Definicja: Etykiety mówców i znaczniki czasu to metadane transkryptu, które przypisują mowę do spójnej osoby lub roli oraz łączą słowa, wypowiedzi lub sygnały napisów z dokładnymi pozycjami w źródłowym audio.

Czym są etykiety mówców i znaczniki czasu?
Etykiety mówców i znaczniki czasu rozwiązują dwa różne pytania: kto jest odpowiedzialny za dany fragment oraz gdzie ten fragment występuje w źródle. Użyteczny transkrypt trzyma te pytania osobno, ponieważ system może dokładnie lokalizować i rozdzielać głosy, a mimo to przypisać błędne prawdziwe nazwisko.
| Termin | Krótka definicja | Co może ustalić | Czego samodzielnie nie może ustalić |
|---|---|---|---|
| Diarizacja mówców | Dzieli audio według głosu i przypisuje spójne, wygenerowane etykiety do wypowiedzi mówców. | Kto kiedy mówił w odniesieniu do innych wykrytych głosów. | Zweryfikowane nazwisko osoby, jej rola, uprawnienia ani intencja. |
| Identyfikacja mówcy | Mapuje wykryty głos na zweryfikowaną osobę lub rolę w projekcie. | Czytelna dla człowieka etykieta wsparta listą uczestników, przedstawieniem lub znanym nagraniem. | Perfekcyjne przypisanie, gdy głosy się nakładają lub dowody są niejasne. |
| Interwał znacznika czasu | Czas rozpoczęcia i zakończenia dla słowa, wypowiedzi, segmentu lub sygnału napisów. | Okno źródłowe powiązane z tekstem. | Czy słowa lub etykieta mówcy są poprawne. |
| Znacznik zdarzenia | Spójna notacja znaczącego dźwięku lub stanu źródła, np. [laughter], [door closes], [overlapping speech] lub [inaudible 00:24]. | Kontekst, którego sama mowa nie oddaje. | Niesłyszalnych słów ani niezweryfikowanej tożsamości. |
Google Cloud opisuje diarizację jako wykrywanie zmian mówcy i przypisywanie etykiet różnym głosom. Dokumentacja IBM idzie dalej: wygenerowane identyfikatory mogą nie być sekwencyjne, tymczasowe identyfikatory mogą się zmieniać, a tej samej etykiety nie należy interpretować jako zweryfikowanego nazwiska bez innego źródła dowodowego.
Źródła: Google Cloud: Wykrywanie różnych mówców i IBM Cloud: Etykiety mówców, zweryfikowane 2026-08-05.

Jaka jest poprawna etykieta mówcy w transkrypcji?
Poprawna etykieta mówcy to najbardziej szczegółowe przypisanie, które uzasadniają dowody, stosowane konsekwentnie od początku do końca. Styl wizualny ma drugorzędne znaczenie. Etykieta ma pomagać docelowemu czytelnikowi odróżniać wypowiedzi bez nadmiernego zwiększania pewności.
| Dostępne dowody | Zalecana etykieta | Przykład | Zasada weryfikacji |
|---|---|---|---|
| Tożsamość potwierdzona i istotna | Zweryfikowane pełne imię i nazwisko | Maya Chen: | Dopasuj do autoprezentacji, zatwierdzonej listy lub znanego głosu referencyjnego. |
| Rola ważniejsza niż nazwisko | Stała rola | Interviewer: | Potwierdź rolę i używaj jednej pisowni przez cały czas. |
| Głosy rozdzielone, ale tożsamości nieznane | Identyfikator anonimowy | Speaker 2: | Zachowaj stałe mapowanie; nie zakładaj, że numer ma porządek chronologiczny. |
| Tożsamości nie da się potwierdzić | Wyraźna niepewność | Unknown speaker: | Pozostaw jako nieznane, dopóki audio lub dokumentacja projektu nie umożliwią korekty. |
Można: zmienić anonimową etykietę po potwierdzeniu głosu. Nie można: traktować numeru diarizacji, kolejności wyświetlania, akcentu, stanowiska wspomnianego przez inną osobę ani prawdopodobnego głosu jako dowodu tożsamości.
W napisach wizualne umiejscowienie czasem pozwala rozpoznać mówcę widocznego na ekranie bez powtarzania nazwiska. DCMP zaleca wyraźną identyfikację mówcy i spójny sposób prezentacji; zauważa też, że właściwe nazwy użyte jako identyfikatory mówców zapisuje się wielką literą, natomiast ogólne oznaczenia zwykle małą. Zwykła transkrypcja może używać standardowej kapitalizacji nazwiska i dwukropka.
Źródło: DCMP Captioning Key, zrecenzowano 2026-08-05.

Jaki format etykiety mówcy jest poprawny?
Nie istnieje uniwersalny format etykiety mówcy. Poprawny format to ten wymagany przez miejsce docelowe i stosowany konsekwentnie. Użyj czytelnej etykiety wypowiedzi w dokumentach, maszynowo czytelnej adnotacji głosu dla WebVTT oraz dokładnego stylu klienta, gdy sąd, nadawca, projekt badawczy, dostawca dostępności lub archiwum definiują własny.
| Materiał | Zalecany wzorzec | Przykład | Główne ograniczenie |
|---|---|---|---|
| Czytelna transkrypcja | Znacznik czasu + zweryfikowana etykieta + dwukropek | [00:09] Maya Chen: The pilot starts September 22. | To nie jest plik napisów ani wyrównanie na poziomie słów. |
| Wywiad oparty na roli | Stała rola + dwukropek | Interviewer: What changed? | Może ukrywać tożsamość, gdy projekt badawczy wymaga atrybucji imiennej. |
| Anonimowa transkrypcja badawcza | Kod uczestnika | P03: The handoff was unclear. | Kod musi być zarządzany oddzielnie od tożsamości osobowej. |
| Napisy WebVTT | Przedział cue + zakres głosu | <v Maya Chen>The pilot starts September 22. | Obsługa odtwarzacza i zasady rozmieszczania napisów nadal mają znaczenie. |
Unikaj przechodzenia między Maya, M. Chen, Speaker 1 i Manager w odniesieniu do tego samego głosu. Jeśli tożsamość zostanie skorygowana w połowie przeglądu, zaktualizuj każdą wcześniejszą wypowiedź i sprawdź ponownie każde podsumowanie, zadanie, cytat lub odpowiedź pochodzącą ze starej etykiety.
Gdzie w transkrypcji powinno pojawić się odniesienie czasowe?
Najszybszym i użytecznym domyślnym rozwiązaniem dla czytelnej transkrypcji z wieloma mówcami jest znacznik czasu na początku wypowiedzi, umieszczony bezpośrednio przed etykietą mówcy. Daje to recenzentowi jeden punkt kliknięcia lub przewijania na każdą zmianę rozmówcy, bez zapełniania każdego zdania danymi czasu. Wybierz inny poziom tylko wtedy, gdy wymaga tego następne zadanie.
| Typ odniesienia czasowego | Przykład | Najlepsze do | Kompromis |
|---|---|---|---|
| Sekcja lub rozdział | 00:15:00 Ryzyka zakupowe | Podcast, wykład lub nawigacja po długim spotkaniu | Zbyt zgrubne do weryfikacji cytatu. |
| Początek wypowiedzi | [00:02:14] Maya Chen: | Czytelne wywiady i transkrypcje spotkań | Nie pokazuje dokładnego końca. |
| Przedział wypowiedzi | [00:02:14-00:02:19] | Edycja, przegląd dowodów i nakładające się wypowiedzi | Więcej szumu wizualnego. |
| Przedział wskazówki napisów | 00:02:14.000 --> 00:02:19.000 | Czas wyświetlania WebVTT | Wymaga poprawnej składni cue i czytelnej segmentacji. |
| Przesunięcie na poziomie słowa | "pilot" 134.2s-134.7s | Dopasowanie, wyszukiwanie i automatyczna kontrola jakości | Zwykle nieodpowiednie jako widoczny tekst. |
Google Cloud udostępnia przesunięcia początku i końca dla rozpoznanych słów. W3C WebVTT definiuje cue jako przedziały czasowe wyrównane z dźwiękiem lub wideo i używa kropki dla milisekund, jak w 00:11.000 --> 00:13.000. Nawiasy kwadratowe w transkrypcji są konwencją redakcyjną, a nie wymogiem WebVTT.
Może: przechowywać timing na poziomie słów, pokazując tylko znaczniki czasu na poziomie wypowiedzi. Nie może: zakładać, że bardziej granularny timing dowodzi poprawności rozpoznania lub atrybucji.
Źródła: Google Cloud: Word time offsets i W3C WebVTT, sprawdzone 2026-08-05.

Czym różnią się pełny zapis dosłowny, inteligentny zapis dosłowny i napisy?
To samo źródłowe audio może dać trzy poprawne wyniki, ponieważ każdy format ma inne zadanie. Pełny zapis dosłowny zachowuje cechy mowy, inteligentny zapis dosłowny poprawia czytelność, zachowując znaczenie i atrybucję, a napisy segmentują tekst do synchronizowanego wyświetlania.
Kontrolowany przykładowy materiał redakcyjny: O 00:09.100 Maya mówi: „Um, więc ja, ja myślę, że pilotaż zaczyna się 22 września.” O 00:11.500 Luis wchodzi jej w słowo: „Po zatwierdzeniu przez dział zakupów.” O 00:13.300 Maya mówi: „Tak.” To jest skonstruowany próbny przykład QA, a nie podpisany test produktu.
Pełny zapis dosłowny
[00:09.100-00:12.700] Maya: Um, więc ja, ja myślę, że pilotaż zaczyna się 22 września.
[00:11.500-00:13.200] Luis: [nakładająca się mowa] Po zatwierdzeniu przez dział zakupów.
[00:13.300-00:13.800] Maya: Tak.
Używaj tego poziomu, gdy powtórzenia, wypełniacze, pauzy, przerwania i rywalizacja o głos są istotne dla analizy lub specyfikacji projektu. Zdefiniuj każde oznaczenie w arkuszu stylu.
Inteligentny zapis dosłowny
[00:09] Maya: Myślę, że pilotaż zaczyna się 22 września.
[00:11] Luis: [nakładająca się mowa] Po zatwierdzeniu przez dział zakupów.
[00:13] Maya: Tak.
Ta wersja usuwa niepłynności, ale nie łączy warunku Luisa ze zdaniem Mayi. Oczyszczanie języka nie może przenosić własności wypowiedzi.
Fragment napisów WebVTT
WEBVTT
00:09.100 --> 00:12.700
<v Maya>Myślę, że pilotaż zaczyna się 22 września.
00:11.500 --> 00:13.200
<v Luis>Po zatwierdzeniu przez dział zakupów.
00:13.300 --> 00:13.800
<v Maya>Tak.
WebVTT używa czasu początkowego i końcowego cue oraz obsługuje zakres głosu. Produkcja napisów musi też uwzględniać tempo czytania, łamanie wierszy, pozycjonowanie i jednoczesne cue. DCMP zaleca synchronizację, zgodność treści, identyfikację mówcy i istotne informacje dźwiękowe; zasady FCC dotyczące napisów telewizyjnych używają kryteriów przeglądu: accurate, synchronous, complete i properly placed.
Źródła: W3C WebVTT, DCMP Captioning Key i 47 CFR 79.1, sprawdzone 2026-08-05. Zasady jakości napisów CFR odnoszą się do zdefiniowanego kontekstu telewizyjnego; ten artykuł używa czterech terminów jakości jako kryteriów przeglądu, a nie jako uniwersalnego twierdzenia prawnego.

Jak należy obsługiwać nakładanie się wypowiedzi, nieznanych mówców i znaczniki zdarzeń?
Nakładanie się wypowiedzi jest zarówno problemem transkrypcji, jak i atrybucji. Jeśli obie wypowiedzi są zrozumiałe, zachowaj oba głosy z przecinającymi się przedziałami. Jeśli zrozumiały jest tylko jeden głos, przepisz ten głos i zaznacz warunek tylko wtedy, gdy pomaga to czytelnikowi. Jeśli żaden nie jest wiarygodny, oznacz źródło jako niesłyszalne i wróć do niego podczas kontroli jakości.
- Nakładające się zrozumiałe wypowiedzi: zachowuj oddzielne etykiety i przedziały czasowe; nie łącz dwóch mówców w jedno zdanie.
- Krótkie potwierdzenia: dokładnie weryfikuj „tak”, „jasne” i „mhm”, ponieważ diarizacja często błędnie przypisuje krótkie wypowiedzi.
- Nieznana tożsamość: używaj
Unknown speaker:lub stabilnego anonimowego identyfikatora zamiast prawdopodobnego imienia. - Niejasne słowa: używaj zdefiniowanego w projekcie znacznika, np.
[inaudible 00:24]; nigdy nie zapisuj słowa, które recenzent spodziewał się usłyszeć. - Znaczące dźwięki: używaj zwięzłych, małymi literami opisów, takich jak
[laughter],[door closes]lub[phone rings], gdy wpływają na zrozumienie. - Cisza i pauzy: oznaczaj je tylko wtedy, gdy czas trwania lub efekt konwersacyjny ma znaczenie dla rezultatu.
IBM ostrzega, że przesłuchy lub nakładanie się głosów mogą być trudne albo niemożliwe do dokładnego rozpoznania w mieszanym audio, a krótkie wypowiedzi, szum, dominujący mówca i duża liczba uczestników również mogą obniżać skuteczność etykietowania mówców. Oddzielne nagrane kanały mogą zmniejszyć potrzebę zgadywania, kto mówił, ale kanały nadal wymagają synchronizacji i kontroli jakości.
Jakie są ograniczenia automatycznej identyfikacji mówcy?
Systemy automatyczne mogą przyspieszyć segmentację i nawigację po źródle, ale wynik diarizacji to metadane wstępne. Traktuj je jak kolejkę do weryfikacji, a nie ostateczny zapis tożsamości.
| Błąd | Dlaczego do niego dochodzi | Widoczny objaw | Działanie recenzenta |
|---|---|---|---|
| Zmiana mówcy | Podobne głosy lub słabe przejście | Zdanie jednej osoby pojawia się pod inną etykietą | Odtwórz fragment przed i po zmianie oraz popraw cały objęty nią przebieg. |
| Widmowy mówca | Szum lub zmienność głosu | Pojawia się nowa etykieta, choć nie dołączyła żadna nowa osoba | Scalaj tylko po potwierdzeniu głosu w porównaniu z sąsiednimi wypowiedziami. |
| Przeoczony mówca | Krótki wkład albo dominujący główny mówca | Krótki uczestnik zostaje przypisany do głównego głosu | Sprawdzaj ręcznie przerwania i krótkie potwierdzenia. |
| Załamanie nakładania | Pojedynczy mieszany kanał | Dwa głosy stają się jednym urwanym zdaniem | Jeśli to możliwe, użyj odtwarzania przedziałowego lub oddzielnych ścieżek. |
| Dryf etykiety tymczasowej | Model koryguje ocenę wraz z napływem kolejnych danych audio | Numery mówców zmieniają się między wynikiem częściowym a końcowym | Wykonaj mapowanie tożsamości na końcowym transkrypcie, a potem go ujednolić. |
Można: używać diarizacji do ustalania priorytetu przeglądu zmian mówcy. Nie można: gwarantować, że każdy głos, przerwanie czy imię będzie poprawne bez odsłuchania źródła.
Jak przeprowadzać ręczną kontrolę jakości etykiet mówców i znaczników czasu?
Zacznij od materiału wysokiego ryzyka zamiast odtwarzać plik liniowo: decyzji, zobowiązań, nazwisk, dat, liczb, cytatów, zewnętrznych obietnic i miejsc, w których głosy się nakładają. Następnie ujednolić cały dokument.
- Przygotuj listę osób i styl. Wypisz oczekiwanych mówców, zatwierdzone imiona lub role, format wyjściowy, dokładność znaczników czasu, konwencję znaczników zdarzeń i ograniczenia prywatności.
- Zakotwicz znane głosy. Użyj autoprezentacji lub innego zweryfikowanego momentu źródłowego, aby powiązać głos z prawdziwym nazwiskiem; nie wnioskuj tożsamości na podstawie numeru diarizacji.
- Sprawdź zmiany mówcy. Odtwórz pierwsze przekazanie głosu i każdą decyzję wysokiego ryzyka, cytat, właściciela, termin, krótkie potwierdzenie i przerwanie.
- Rozstrzygnij nakładanie i niepewność. Zachowaj zrozumiałe jednoczesne wypowiedzi, konsekwentnie oznaczaj przydatne nakładanie się głosów lub zdarzenia dźwiękowe oraz pozostawiaj znaczniki Unknown speaker lub inaudible, gdy dowody są niewystarczające.
- Sprawdź wyrównanie znaczników czasu. Potwierdź, że znaczniki czasu rozpoczęcia wypowiedzi lub przedziału otwierają właściwy moment źródłowy oraz że początki, końce i kolejność czytania znaczników napisów odpowiadają audio.
- Ujednolić dokument. Zastosuj jedną pisownię etykiet, wielkość liter, interpunkcję, wzór znacznika czasu i styl znacznika zdarzenia w całym rezultacie.
- Sprawdź ponownie wyniki pochodne. Po poprawieniu etykiety lub czasu zweryfikuj podsumowania, listy działań, cytaty, eksporty i cytowane odpowiedzi, aby błąd nie przetrwał dalej w potoku.
Najszybszy obroniony workflow: używaj stabilnych wygenerowanych etykiet i znaczników czasu rozpoczęcia wypowiedzi, sprawdź autoprezentację lub pierwszy wyraźny próbkę dla każdego głosu, przejrzyj każde istotne przekazanie głosu, a następnie globalnie zmień nazwy etykiet. Jeśli rezultat jest wysokiego ryzyka, użyj drugiego recenzenta albo udokumentowanej reguły próbkowania zamiast zakładać, że pierwszy przebieg jest kompletny.
Sprawdzone: przejrzano wyniki Google i Bing SERP oraz strony Google Cloud, IBM Cloud, W3C, DCMP i FCC w dniu 2026-08-05. N/D: przesyłanie audio, wynik diarizacji, dokładność produktu, zgodność recenzentów, szybkość przetwarzania i dostępność funkcji po zalogowaniu.

Jak etykiety mówców, znaczniki czasu i cytowania wzajemnie się weryfikują?
Transkrypt staje się oparty na źródle, gdy etykieta, czas źródłowy i wynik pochodny można sprawdzić jako jeden łańcuch. Samo poprawienie transkryptu nie wystarczy, jeśli zadanie do wykonania lub odpowiedź AI nadal zawiera starego właściciela.
Kontrolowana demonstracja redakcyjna; pomiar produktu N/D.
00:09 Maya Chen: "Pilotaż zaczyna się 22 września."
00:24 Speaker 2: "Wyślę listę dostępu do 15 września."
00:41 Maya Chen: "Zatwierdzenie zakupu nadal jest otwarte."
Ścieżka weryfikacji: otwórz 00:24, porównaj głos ze zweryfikowanym wstępem Luisa Ortiza, zmień Speaker 2 na Luis Ortiz i ponownie uruchom lub sprawdź każdy wynik pochodny.
Skorygowany element działania: Luis Ortiz — wyślij listę dostępu — termin: 15 września — źródło 00:24.
Przytoczona odpowiedź: „Kto jest właścicielem listy dostępu?” Luis Ortiz [00:24].
Poprawka jest kompletna tylko wtedy, gdy transkrypt, podsumowanie, element działania, eksport i przytoczona odpowiedź używają imienia Luis. Jeśli tożsamości nie da się zweryfikować, uczciwą odpowiedzią jest: element działania należy do Speaker 2, ze źródłem 00:24, do czasu identyfikacji.
Gdzie HiNoter pasuje do tego przepływu pracy?
HiNoter to narzędzie AI do spotkań i notatek z wielu źródeł, które zamienia autoryzowane spotkania, filmy z YouTube, pliki PDF oraz materiały wideo i audio w uporządkowane notatki i odpowiedzi z cytowaniami.
Po autoryzacji spotkania lub pliku do przetwarzania HiNoter można ocenić pod kątem nawigacji po transkrypcji z etykietami mówiących, odtwarzania znaczników czasu, korekty etykiet, uporządkowanych podsumowań, elementów działania oraz odpowiedzi AI Chat, które odsyłają do momentów źródłowych. Link do źródła sprawia, że korektę można sprawdzić; nie czyni pierwotnej automatycznej etykiety nieomylnej.
Informacje podane przez użytkownika / do weryfikacji przed publikacją: Edycja etykiet mówiących, nawigacja po znacznikach czasu, automatyczna obecność, generowanie transkryptu, szybkość przetwarzania, obsługa języków, uporządkowane notatki, integracje oraz AI Chat z odsyłaczami do źródeł nie zostały przetestowane w zalogowanym koncie HiNoter dla tej strony. Przed publikacją zweryfikuj bieżące działanie, plan konta, format eksportu, ustawienia prywatności, dostęp do źródeł, propagację korekt i opcje usuwania.
Odwiedź HiNoter, przetestuj przepływ audio-to-text, porównaj notatki ze spotkań AI, sprawdź odnośniki źródłowe AI Chat, przejrzyj politykę prywatności i zobacz integrację z Google Docs. Powiązany wielojęzyczny przepływ transkrypcji wyjaśnia, dlaczego przypisanie mówiącego i znaczenie między językami to oddzielne kontrole jakości.

Jakie kontrole prywatności i uprawnień są wymagane?
Etykiety mówiących mogą przekształcić ogólny transkrypt w dane osobowe, łącząc głos, imię, rolę, wypowiedź i czas. Przetwarzaj wyłącznie audio, którego jesteś właścicielem lub do którego masz upoważnienie, informuj uczestników, gdy jest to wymagane, i ogranicz transkrypt oraz nagranie źródłowe do osób, które ich potrzebują.
- Udokumentuj cel nagrywania, transkrypcji, identyfikacji mówiących i dalszego przetwarzania AI.
- Używaj kodów uczestników zamiast imion, gdy projekt badawczy lub projekt prywatności wymaga deidentyfikacji.
- Nie wyciągaj wniosków o wrażliwych cechach tożsamości na podstawie głosu.
- Ogranicz dostęp do listy powiązań anonimowych kodów uczestników z prawdziwymi imionami.
- Zastosuj zasady retencji i usuwania zarówno do transkryptu, jak i do źródłowego audio.
- W przypadku materiałów prawnych, HR, medycznych, obsługi klienta lub regulowanych zaangażuj odpowiedzialnego właściciela ds. prywatności lub zgodności.
To jest przewodnik po procesie, a nie porada prawna. Należy sprawdzić warunki prywatności produktu oraz lokalne przepisy dotyczące nagrywania lub danych biometrycznych w odniesieniu do rzeczywistych uczestników, jurysdykcji i przypadku użycia.
Najczęściej zadawane pytania
Czym jest etykieta mówiącego w transkrypcji?
Etykieta mówiącego w transkrypcji identyfikuje osobę, rolę lub anonimowy głos odpowiedzialny za dany fragment wypowiedzi. Przykładami są Maya Chen, Prowadzący rozmowę, Speaker 2 i Nieznany mówiący. Etykieta powinna pozostać spójna i nie powinna przypisywać prawdziwej tożsamości, chyba że została ona zweryfikowana na podstawie źródła lub dokumentacji projektu.
Która etykieta mówiącego jest poprawna?
Poprawna etykieta mówiącego to najbardziej szczegółowa etykieta, jaką wspierają dowody: zweryfikowane imię, gdy tożsamość ma znaczenie, rola, gdy rola wystarcza, stabilny anonimowy numer, gdy diarizacja rozdzieliła tylko głosy, lub Nieznany mówiący, gdy tożsamości nie da się potwierdzić. Spójność i weryfikowalność są ważniejsze niż ozdobne formatowanie.
Jaki jest prawidłowy format etykiety mówiącego?
Dla czytelnej transkrypcji użyj jednej etykiety, po której następuje dwukropek na początku każdej wypowiedzi, na przykład [00:09] Maya Chen: Pilotaż rozpoczyna się 22 września. W podpisach stosuj specyfikację docelowego pliku; WebVTT obsługuje znacznik voice span, który identyfikuje mówiącego w cue. Klient, sąd, nadawca lub projekt badawczy mogą wymagać innego stylu redakcyjnego.
Gdzie w transkrypcji powinno pojawić się odniesienie czasowe?
W ogólnym transkrypcie umieść znacznik czasu początku wypowiedzi bezpośrednio przed etykietą mówiącego. Używaj przedziałów start-koniec, gdy redaktor potrzebuje dokładnych granic, okresowych znaczników czasu tylko wtedy, gdy projekt tego wymaga, oraz przedziałów cue dla napisów. Czas na poziomie słów najlepiej przechowywać jako dane wyrównania czytelne maszynowo, a nie drukować przed każdym słowem.
Jak należy oznaczać nakładających się lub nieznanych mówiących?
Zachowaj obie wypowiedzi, gdy słowa są zrozumiałe, i nadaj każdej z nich przedział czasowy. Dodaj spójny znacznik stanu, taki jak [nakładająca się mowa], gdy pomaga to recenzentowi. Jeśli głosu lub słów nie da się zweryfikować, użyj Nieznany mówiący lub [niesłyszalne 00:24] zamiast przypisywać prawdopodobne nazwisko lub wymyślać tekst.
Co HiNoter robi z etykietami mówiących i znacznikami czasu?
Po autoryzacji HiNoter można ocenić pod kątem nawigacji po transkrypcji, edycji etykiet mówiących, uporządkowanych notatek, elementów działania oraz odpowiedzi AI Chat, które wracają do źródłowych znaczników czasu. Te zachowania produktu zostały podane przez użytkownika na potrzeby tego artykułu i przed publikacją muszą zostać zweryfikowane w aktualnym produkcie, planie, ustawieniach prywatności i przepływie odnośników do źródeł.
Sprawdź autoryzowany transkrypt względem jego źródła
Najpierw przejrzyj kontrolowany przykład powyżej. Następnie przetwórz jedno autoryzowane spotkanie lub plik w HiNoter, popraw etykiety mówiących, otwórz źródłowe znaczniki czasu i potwierdź, że podsumowanie, elementy działania i odpowiedzi AI Chat zawierają skorygowane przypisanie.
Przetwórz autoryzowane spotkanie lub plik | Zobacz AI Chat z odsyłaczami do źródeł