Etykiety mówców i znaczniki czasu sprawiają, że transkrypcja jest przeszukiwalna, pozwala przypisać wypowiedzi do osób i ułatwia weryfikację, ale tylko wtedy, gdy format odpowiada materiałowi wynikowemu. W przypadku znanych uczestników używaj zweryfikowanych imion i nazwisk, etykiet ról, gdy tożsamość nie jest istotna, stałych anonimowych etykiet, gdy rozdzielane są tylko głosy, oraz etykiety Nieznany mówca, gdy nie można potwierdzić tożsamości. Aby transkrypcje były czytelne, dodawaj znacznik czasu przy każdej zmianie mówcy; używaj przedziałów początek-koniec do edycji lub celów dowodowych oraz przedziałów czasowych napisów w przypadku napisów. Ten przewodnik definiuje terminy, porównuje formaty, omawia nakładające się wypowiedzi i przedstawia powtarzalny proces kontroli jakości wykonywanej przez człowieka.
Bezpośrednia odpowiedź: Etykiety mówców identyfikują każdą turę wypowiedzi, a znaczniki czasu łączą tę turę z momentem w źródle. Najszybszym niezawodnym rozwiązaniem domyślnym jest zweryfikowane imię i nazwisko lub stała etykieta roli wraz ze znacznikiem początku tury, na przykład [00:09] Maya Chen:. Używaj przedziałów do edycji, czasów rozpoczęcia i zakończenia kwestii w przypadku napisów, a zamiast zgadywać tożsamość stosuj etykietę Nieznany mówca.
Definicja: Etykiety mówców i znaczniki czasu to metadane transkrypcji, które przypisują wypowiedzi do konkretnej osoby lub roli w spójny sposób oraz łączą słowa, tury wypowiedzi lub kwestie napisów z dokładnymi pozycjami w źródłowym nagraniu audio.

Czym są etykiety mówców i znaczniki czasu?
Etykiety mówców i znaczniki czasu odpowiadają na dwa różne pytania: kto odpowiada za dany fragment oraz gdzie ten fragment występuje w źródle. Przydatna transkrypcja rozdziela te kwestie, ponieważ system może dokładnie zlokalizować i rozdzielić głosy, a jednocześnie przypisać im niewłaściwe imię i nazwisko w świecie rzeczywistym.
| Termin | Krótka definicja | Co może ustalić | Czego nie może ustalić samodzielnie |
|---|---|---|---|
| Diarizacja mówców | Dzieli nagranie audio według głosów i przypisuje spójne, wygenerowane etykiety poszczególnym turom wypowiedzi. | Kto mówił i kiedy w odniesieniu do innych wykrytych głosów. | Zweryfikowanego imienia i nazwiska osoby, jej roli, uprawnień ani intencji. |
| Identyfikacja mówcy | Łączy wykryty głos ze zweryfikowaną osobą w świecie rzeczywistym lub rolą w projekcie. | Czytelną dla człowieka etykietę popartą listą uczestników, przedstawieniem się lub znanym nagraniem. | Perfekcyjnego przypisania, gdy głosy nakładają się na siebie lub dowody są niejasne. |
| Przedział czasowy | Czas rozpoczęcia i zakończenia słowa, tury wypowiedzi, segmentu lub kwestii napisów. | Okno źródłowe powiązane z tekstem. | Tego, czy słowa lub etykieta mówcy są poprawne. |
| Znacznik zdarzenia | Spójny zapis znaczącego dźwięku lub stanu źródła, takiego jak [śmiech], [zamykają się drzwi], [nakładające się wypowiedzi] lub [niesłyszalne 00:24]. | Kontekst, którego nie oddają same wypowiedziane słowa. | Niesłyszanych słów ani niezweryfikowanej tożsamości. |
Google Cloud opisuje diarizację jako wykrywanie zmian mówcy i przypisywanie etykiet różnym głosom. Dokumentacja IBM idzie dalej: wygenerowane identyfikatory mogą nie być sekwencyjne, identyfikatory tymczasowe mogą się zmieniać, a tej samej etykiety nie należy interpretować jako zweryfikowanego imienia i nazwiska bez dodatkowego źródła dowodowego.
Źródła: Google Cloud: Wykrywanie różnych mówców oraz IBM Cloud: Etykiety mówców, zweryfikowano 2026-08-05.

Jaka jest prawidłowa etykieta mówcy w transkrypcji?
Prawidłowa etykieta mówcy to najbardziej szczegółowe przypisanie, jakie potwierdzają dowody, stosowane konsekwentnie od początku do końca. Styl wizualny ma drugorzędne znaczenie. Etykieta musi pomagać docelowemu czytelnikowi odróżniać tury wypowiedzi bez zawyżania poziomu pewności.
| Dostępne dowody | Zalecana etykieta | Przykład | Zasada weryfikacji |
|---|---|---|---|
| Tożsamość potwierdzona i istotna | Zweryfikowane imię i nazwisko | Maya Chen: | Porównaj z przedstawieniem się, zatwierdzoną listą lub znanym głosem referencyjnym. |
| Rola ma większe znaczenie niż imię i nazwisko | Stała rola | Prowadzący wywiad: | Potwierdź rolę i stosuj jeden zapis w całym tekście. |
| Głosy są rozdzielone, ale tożsamości są nieznane | Anonimowy identyfikator | Mówca 2: | Zachowaj stałe przypisanie; nie zakładaj, że numer jest chronologiczny. |
| Nie można potwierdzić tożsamości | Wyraźne wskazanie niepewności | Nieznany mówca: | Pozostaw oznaczenie nieznane, dopóki nagranie lub dokumentacja projektu nie uzasadnią korekty. |
Można: zmienić anonimową etykietę po zweryfikowaniu głosu. Nie można: traktować numeru diarizacji, kolejności wyświetlania, akcentu, stanowiska wspomnianego przez inną osobę ani prawdopodobnego głosu jako dowodu tożsamości.
W napisach wizualne umiejscowienie może czasem identyfikować mówcę widocznego na ekranie bez powtarzania imienia i nazwiska. DCMP zaleca wyraźną identyfikację mówców i spójny sposób prezentacji; odnotowuje również, że nazwy własne używane jako identyfikatory mówców zapisuje się wielką literą, podczas gdy ogólne identyfikatory zwykle zapisuje się małą literą. W zwykłej transkrypcji można stosować standardową kapitalizację imienia i nazwiska, po której następuje dwukropek.
Źródło: DCMP Captioning Key, przegląd z 2026-08-05.

Który format etykiety mówcy jest prawidłowy?
Nie ma uniwersalnego formatu etykiet mówców. Prawidłowy format to ten wymagany przez miejsce docelowe i stosowany konsekwentnie. W dokumentach używaj czytelnej etykiety wypowiedzi, w WebVTT — przeznaczonej dla maszyn adnotacji głosu, a gdy sąd, nadawca, projekt badawczy, dostawca usług dostępności lub archiwum określa konkretny styl — dokładnie tego stylu klienta.
| Materiał | Zalecany wzorzec | Przykład | Główne ograniczenie |
|---|---|---|---|
| Czytelna transkrypcja | Znacznik czasu + zweryfikowana etykieta + dwukropek | [00:09] Maya Chen: Pilotaż rozpoczyna się 22 września. | To nie jest plik napisów ani synchronizacja na poziomie słów. |
| Wywiad oparty na rolach | Stała rola + dwukropek | Prowadzący wywiad: Co się zmieniło? | Może ukrywać tożsamość, gdy projekt badawczy wymaga przypisania wypowiedzi do konkretnych osób. |
| Anonimowa transkrypcja badawcza | Kod uczestnika | P03: Przekazanie było niejasne. | Kod musi być zarządzany oddzielnie od tożsamości osobowej. |
| Napisy WebVTT | Przedział czasowy cue + zakres głosu | <v Maya Chen>Pilotaż rozpoczyna się 22 września. | Nadal znaczenie ma obsługa przez odtwarzacz i zasady umieszczania napisów. |
Unikaj przełączania się między Maya, M. Chen, Mówca 1 i Menedżer dla tego samego głosu. Jeśli tożsamość zostanie skorygowana w połowie przeglądu, zaktualizuj wszystkie wcześniejsze wypowiedzi i ponownie sprawdź każde podsumowanie, zadanie, cytat lub odpowiedź wywiedzione ze starej etykiety.
Gdzie powinno pojawić się odniesienie czasowe w transkrypcji?
Najszybszym użytecznym ustawieniem domyślnym dla czytelnej transkrypcji z wieloma mówcami jest znacznik czasu początku wypowiedzi umieszczony bezpośrednio przed etykietą mówcy. Daje on osobie sprawdzającej jeden punkt do kliknięcia lub przewinięcia przy każdej zmianie mówcy, bez wypełniania każdej wypowiedzi danymi czasowymi. Wybierz inny poziom tylko wtedy, gdy wymaga tego kolejne zadanie.
| Typ odniesienia czasowego | Przykład | Najlepsze zastosowanie | Kompromis |
|---|---|---|---|
| Sekcja lub rozdział | 00:15:00 Ryzyka związane z zamówieniami | Nawigacja po podcastach, wykładach lub długich spotkaniach | Zbyt mało szczegółowe do weryfikacji cytatów. |
| Początek wypowiedzi | [00:02:14] Maya Chen: | Czytelne transkrypcje wywiadów i spotkań | Nie pokazuje dokładnego końca. |
| Przedział wypowiedzi | [00:02:14-00:02:19] | Edycja, przegląd dowodów i nakładające się wypowiedzi | Więcej szumu wizualnego. |
| Przedział wyświetlania napisów | 00:02:14.000 --> 00:02:19.000 | Czas wyświetlania WebVTT | Wymaga poprawnej składni cue i czytelnego podziału. |
| Przesunięcie na poziomie słowa | "pilot" 134.2s-134.7s | Wyrównanie, wyszukiwanie i automatyczna kontrola jakości | Zwykle nie nadaje się do widocznego tekstu ciągłego. |
Google Cloud udostępnia przesunięcia początkowe i końcowe dla rozpoznanych słów. W3C WebVTT definiuje cue jako przedziały czasowe zsynchronizowane z dźwiękiem lub obrazem i używa kropki do oznaczania milisekund, jak w 00:11.000 --> 00:13.000. Nawiasy kwadratowe w transkrypcji są konwencją redakcyjną, a nie wymogiem WebVTT.
Można: przechowywać znaczniki czasu na poziomie słów, wyświetlając jedynie znaczniki czasu na poziomie wypowiedzi. Nie można: zakładać, że dokładniejsze znaczniki czasu dowodzą poprawności rozpoznania lub przypisania wypowiedzi.
Źródła: Google Cloud: przesunięcia czasowe słów oraz W3C WebVTT, przegląd z 2026-08-05.

Czym różnią się pełna transkrypcja dosłowna, inteligentna transkrypcja dosłowna i napisy?
Ten sam dźwięk źródłowy może wygenerować trzy prawidłowe wyniki, ponieważ każdy format ma inne zadanie. Pełna transkrypcja dosłowna zachowuje sposób mówienia, inteligentna transkrypcja dosłowna ułatwia lekturę przy zachowaniu znaczenia i przypisania wypowiedzi, a napisy dzielą tekst na segmenty do zsynchronizowanego wyświetlania.
Kontrolowana próbka źródła redakcyjnego: O 00:09.100 Maya mówi: "Um, więc ja, ja myślę, że pilotaż zaczyna się 22 września." O 00:11.500 Luis nakłada się z wypowiedzią: "Oczekuje na zatwierdzenie zamówienia." O 00:13.300 Maya mówi: "Racja." To skonstruowana próbka QA, a nie podpisany test produktu.
Pełna transkrypcja dosłowna
[00:09.100-00:12.700] Maya: Um, więc ja, ja myślę, że pilotaż zaczyna się 22 września.
[00:11.500-00:13.200] Luis: [nakładająca się mowa] Oczekuje na zatwierdzenie zamówienia.
[00:13.300-00:13.800] Maya: Racja.
Użyj tego poziomu, gdy powtórzenia, wypełniacze, pauzy, przerwania i rywalizacja o głos są częścią analizy lub specyfikacji projektu. Zdefiniuj każdą notację w arkuszu stylu.
Inteligentna transkrypcja dosłowna
[00:09] Maya: Myślę, że pilotaż zaczyna się 22 września.
[00:11] Luis: [nakładająca się mowa] Oczekuje na zatwierdzenie zamówienia.
[00:13] Maya: Racja.
Ta wersja usuwa niepłynności, ale nie łączy warunku Luisa ze zdaniem Mayi. Oczyszczanie języka nie może przenosić autorstwa wypowiedzi.
Fragment napisów WebVTT
WEBVTT
00:09.100 --> 00:12.700
<v Maya>Myślę, że pilotaż zaczyna się 22 września.
00:11.500 --> 00:13.200
<v Luis>Oczekuje na zatwierdzenie zamówienia.
00:13.300 --> 00:13.800
<v Maya>Racja.
WebVTT używa czasu rozpoczęcia i zakończenia cue oraz obsługuje zakres głosu. Tworzenie napisów musi również uwzględniać prędkość czytania, podziały wierszy, rozmieszczenie i jednoczesne cue. DCMP zaleca synchronizację, równoważność treści, identyfikację mówców i istotne informacje o dźwięku; zasady FCC dotyczące napisów telewizyjnych wykorzystują zasady przeglądu: dokładność, synchronizację, kompletność i właściwe umiejscowienie.
Źródła: W3C WebVTT, DCMP Captioning Key oraz 47 CFR 79.1, przegląd z 2026-08-05. Zasady jakości napisów CFR mają zastosowanie do określonego w nich kontekstu telewizyjnego; ten artykuł używa tych czterech terminów jakości jako kryteriów przeglądu, a nie jako uniwersalnego twierdzenia prawnego.

Jak postępować z nakładającymi się wypowiedziami, nieznanymi mówcami i znacznikami zdarzeń?
Nakładanie się wypowiedzi jest zarówno problemem transkrypcji, jak i przypisania wypowiedzi. Jeśli obie wypowiedzi są zrozumiałe, zachowaj obie tury z przecinającymi się przedziałami. Jeśli zrozumiała jest tylko jedna wypowiedź, przepisz tę wypowiedź i oznacz ten warunek tylko wtedy, gdy pomaga to czytelnikowi. Jeśli żadna wypowiedź nie jest wiarygodna, oznacz źródło jako niesłyszalne i wróć do niego podczas kontroli jakości.
- Nachodzące na siebie zrozumiałe wypowiedzi: zachowuj oddzielne etykiety i przedziały czasowe; nie łącz dwóch mówców w jedno zdanie.
- Krótkie wypowiedzi potwierdzające: dokładnie sprawdzaj „yes”, „right” i „mm-hmm”, ponieważ diarizacja często błędnie przypisuje krótkie wypowiedzi.
- Nieznana tożsamość: używaj
Unknown speaker:lub stałego anonimowego identyfikatora zamiast prawdopodobnego imienia i nazwiska. - Niewyraźne słowa: używaj określonego dla projektu oznaczenia, takiego jak
[inaudible 00:24]; nigdy nie zapisuj słowa, które — zdaniem osoby dokonującej przeglądu — powinno być słyszalne. - Znaczące dźwięki: używaj zwięzłych opisów pisanych małymi literami, takich jak
[laughter],[door closes]lub[phone rings], gdy wpływają one na zrozumienie. - Cisza i pauzy: oznaczaj je tylko wtedy, gdy ich długość lub wpływ na rozmowę ma znaczenie dla materiału końcowego.
IBM ostrzega, że rozmowy nakładające się na siebie lub nakładanie się wypowiedzi mogą być trudne albo niemożliwe do dokładnego rozpoznania w zmiksowanym dźwięku, a krótkie wypowiedzi, hałas, dominujący mówca i wielu uczestników również mogą obniżać skuteczność etykietowania mówców. Oddzielne nagrane kanały mogą zmniejszyć potrzebę ustalania, kto mówił, ale kanały nadal wymagają synchronizacji i kontroli jakości.
Jakie są ograniczenia automatycznej identyfikacji mówców?
Systemy automatyczne mogą przyspieszyć segmentację i nawigację po źródle, ale wynik diarizacji jest tymczasowymi metadanymi. Traktuj go jako kolejkę do weryfikacji, a nie końcowy rejestr tożsamości.
| Niepowodzenie | Dlaczego do niego dochodzi | Widoczny objaw | Działanie osoby dokonującej przeglądu |
|---|---|---|---|
| Zamiana mówców | Podobne głosy lub słabo zaznaczona zmiana mówcy | Zdanie jednej osoby pojawia się pod inną etykietą | Odtwórz nagranie przed zmianą i po niej, a następnie popraw cały dotknięty problemem fragment. |
| Widmowy mówca | Hałas lub zmienność głosu | Pojawia się nowa etykieta, chociaż nie dołączyła żadna nowa osoba | Scalaj dopiero po potwierdzeniu głosu na podstawie pobliskich wypowiedzi. |
| Pominięty mówca | Krótka wypowiedź lub dominujący główny mówca | Krótka wypowiedź uczestnika zostaje przypisana do głównego głosu | Ręcznie sprawdź przerwania i krótkie wypowiedzi potwierdzające. |
| Scalenie nakładających się wypowiedzi | Pojedynczy zmiksowany kanał | Dwa głosy stają się jednym przerwanym zdaniem | Jeśli to możliwe, użyj odtwarzania przedziału lub oddzielnych ścieżek. |
| Dryf etykiet tymczasowych | Model zmienia swoje oszacowanie w miarę napływu kolejnych danych audio | Numery mówców zmieniają się między częściowym a końcowym wynikiem | Wykonaj mapowanie tożsamości na końcowej transkrypcji, a następnie ją ujednolić. |
Można: używać diarizacji do ustalania priorytetów podczas przeglądu zmian mówców. Nie można: obiecywać, że każdy głos, przerwanie lub imię i nazwisko będą poprawne bez odsłuchania źródła.
Jak przeprowadzić ludzką kontrolę jakości etykiet mówców i znaczników czasu?
Zamiast odtwarzać plik liniowo, zacznij od materiału wysokiego ryzyka: decyzji, zobowiązań, nazwisk, dat, liczb, cytatów, obietnic zewnętrznych oraz miejsc, w których głosy nakładają się na siebie. Następnie ujednolić cały dokument.
- Przygotuj listę uczestników i styl. Wymień oczekiwanych mówców, zatwierdzone imiona i nazwiska lub role, format wyjściowy, dokładność znaczników czasu, konwencję oznaczania zdarzeń oraz ograniczenia dotyczące prywatności.
- Zakotwicz znane głosy. Użyj autoprezentacji lub innego zweryfikowanego momentu ze źródła, aby powiązać głos z prawdziwym imieniem i nazwiskiem; nie wnioskuj o tożsamości na podstawie numeru diarizacji.
- Sprawdź zmiany mówców. Odtwórz pierwsze przekazanie głosu oraz każdą decyzję wysokiego ryzyka, cytat, osobę odpowiedzialną, termin, krótkie potwierdzenie i przerwanie.
- Rozstrzygnij nakładanie się wypowiedzi i niepewność. Zachowuj zrozumiałe jednoczesne wypowiedzi, konsekwentnie oznaczaj przydatne nakładanie się wypowiedzi lub zdarzenia dźwiękowe, a gdy dowody są niewystarczające, zachowuj oznaczenia Unknown speaker lub inaudible.
- Sprawdź synchronizację znaczników czasu. Potwierdź, że znaczniki początku wypowiedzi lub przedziałów otwierają właściwy moment źródłowy oraz że początki i końce segmentów napisów oraz kolejność ich odczytywania odpowiadają dźwiękowi.
- Ujednolić dokument. W całym materiale końcowym stosuj jeden zapis etykiet, wielkość liter, interpunkcję, wzór znaczników czasu i styl oznaczania zdarzeń.
- Ponownie sprawdź wyniki pochodne. Po poprawieniu etykiety lub czasu zweryfikuj podsumowania, zadania do wykonania, cytaty, eksporty i przywołane odpowiedzi, aby błąd nie pozostał w dalszych etapach.
Najszybszy możliwy do obrony proces: używaj stabilnych wygenerowanych etykiet i znaczników początku wypowiedzi, zweryfikuj przedstawienie się lub pierwszą wyraźną próbkę każdego głosu, sprawdź każde przekazanie głosu o dużym wpływie, a następnie globalnie zmień nazwy etykiet. Jeśli materiał końcowy wiąże się z wysokim ryzykiem, skorzystaj z pomocy drugiej osoby dokonującej przeglądu lub udokumentowanej zasady doboru próby, zamiast zakładać, że pierwsze przejście jest kompletne.
Zmierzono: 5 sierpnia 2026 r. przeanalizowano wyniki SERP Google i Bing oraz strony Google Cloud, IBM Cloud, W3C, DCMP i FCC. Nie dotyczy: przesyłania dźwięku, wyniku diarizacji, dokładności produktu, zgodności ocen osób dokonujących przeglądu, szybkości przetwarzania oraz dostępności funkcji po zalogowaniu.

Jak etykiety mówców, znaczniki czasu i cytowania wzajemnie się weryfikują?
Transkrypcja jest ugruntowana w źródle, gdy etykietę, czas źródłowy i odpowiedź pochodną można sprawdzić jako jedno ogniwo. Sama korekta transkrypcji nie wystarczy, jeśli zadanie do wykonania lub odpowiedź AI nadal wskazuje poprzednią osobę odpowiedzialną.
Kontrolowana demonstracja redakcyjna; pomiar produktu nie dotyczy.
00:09 Maya Chen: "The pilot starts September 22."
00:24 Speaker 2: "I will send the access list by September 15."
00:41 Maya Chen: "Procurement approval is still open."
Ścieżka przeglądu: Otwórz 00:24, porównaj głos ze zweryfikowanym przedstawieniem się Luisa Ortiza, zmień Speaker 2 na Luis Ortiz, a następnie ponownie uruchom lub sprawdź każdy wynik pochodny.
Skorygowana czynność: Luis Ortiz - wysłać listę dostępu - termin 15 września - źródło 00:24.
Przytoczona odpowiedź: "Kto odpowiada za listę dostępu?" Luis Ortiz [00:24].
Korekta jest ukończona dopiero wtedy, gdy transkrypcja, podsumowanie, czynność, eksport i przytoczona odpowiedź wskazują Luisa. Jeśli tożsamości nie można zweryfikować, uczciwa odpowiedź brzmi: Mówca 2 odpowiada za tę czynność, ze źródłem 00:24, do czasu identyfikacji.
Jak HiNoter wpisuje się w ten proces?
HiNoter to narzędzie AI do obsługi spotkań i notatek z wielu źródeł, które przekształca autoryzowane spotkania, filmy z YouTube, pliki PDF oraz materiały wideo i audio w uporządkowane notatki i odpowiedzi z cytowanymi źródłami.
Po autoryzowaniu spotkania lub pliku do przetwarzania HiNoter można ocenić pod kątem nawigacji po transkrypcji z etykietami mówców, odtwarzania znaczników czasu, korekty etykiet, uporządkowanych podsumowań, czynności oraz odpowiedzi AI Chat prowadzących z powrotem do momentów w źródle. Link do źródła umożliwia sprawdzenie korekty; nie sprawia jednak, że pierwotna automatyczna etykieta jest nieomylna.
Podane przez użytkownika / zweryfikuj przed publikacją: Edycja etykiet mówców, nawigacja po znacznikach czasu, automatyczne rejestrowanie obecności, generowanie transkrypcji, szybkość przetwarzania, obsługa języków, uporządkowane notatki, integracje i AI Chat ze źródłami nie zostały przetestowane na zalogowanym koncie HiNoter na potrzeby tej strony. Przed publikacją zweryfikuj bieżące działanie, plan konta, format eksportu, ustawienia prywatności, dostęp do źródeł, propagowanie korekt oraz opcje usuwania.
Odwiedź HiNoter, przetestuj proces konwersji audio na tekst, porównaj notatki AI ze spotkań, sprawdź odniesienia AI Chat do źródeł, zapoznaj się z polityką prywatności i zobacz integrację z Google Docs. Powiązany wielojęzyczny proces pracy z transkrypcją wyjaśnia, dlaczego przypisywanie wypowiedzi mówcom i znaczenie międzyjęzykowe stanowią odrębne kontrole jakości.

Jakie kontrole prywatności i uprawnień są wymagane?
Etykiety mówców mogą przekształcić ogólną transkrypcję w dane osobowe, łącząc głos, imię i nazwisko, rolę, wypowiedź oraz czas. Przetwarzaj wyłącznie dźwięk, którego jesteś właścicielem lub do którego używania masz uprawnienia, powiadamiaj uczestników, gdy jest to wymagane, i ogranicz dostęp do transkrypcji oraz nagrania źródłowego do osób, które go potrzebują.
- Udokumentuj cel nagrywania, transkrypcji, identyfikacji mówców i dalszego przetwarzania AI.
- Stosuj kody uczestników zamiast imion i nazwisk, gdy badanie lub zasady ochrony prywatności wymagają anonimizacji.
- Nie wyciągaj wniosków na temat wrażliwych cech tożsamości na podstawie głosu.
- Ogranicz dostęp do rejestru łączącego anonimowe kody uczestników z prawdziwymi imionami i nazwiskami.
- Stosuj zasady przechowywania i usuwania zarówno do transkrypcji, jak i do powiązanego nagrania audio.
- W przypadku materiałów prawnych, HR, medycznych, dotyczących klientów lub regulowanych zaangażuj osobę odpowiedzialną za prywatność lub zgodność.
To jest przewodnik po procesie, a nie porada prawna. Należy przeanalizować warunki prywatności produktu oraz lokalne przepisy dotyczące nagrywania lub danych biometrycznych pod kątem konkretnych uczestników, jurysdykcji i przypadku użycia.
Często zadawane pytania
Czym jest etykieta mówcy w transkrypcji?
Etykieta mówcy w transkrypcji identyfikuje osobę, rolę lub anonimowy głos odpowiedzialny za daną turę wypowiedzi. Przykładami są Maya Chen, Prowadzący wywiad, Mówca 2 i Nieznany mówca. Etykieta powinna pozostać spójna i nie powinna wskazywać rzeczywistej tożsamości, chyba że została ona zweryfikowana na podstawie źródła lub dokumentacji projektu.
Która etykieta mówcy jest prawidłowa?
Prawidłowa etykieta mówcy to najbardziej szczegółowa etykieta, którą potwierdzają dowody: zweryfikowane imię i nazwisko, gdy tożsamość ma znaczenie, rola, gdy jest wystarczająca, stały anonimowy numer, gdy diarization rozdzieliła tylko głosy, lub Nieznany mówca, gdy tożsamości nie można potwierdzić. Spójność i możliwość weryfikacji są ważniejsze niż ozdobne formatowanie.
Jaki jest prawidłowy format etykiety mówcy?
W czytelnej transkrypcji użyj jednej etykiety, po której na początku każdej tury wypowiedzi następuje dwukropek, na przykład [00:09] Maya Chen: Pilotaż rozpoczyna się 22 września. W przypadku napisów stosuj specyfikację docelowego pliku; WebVTT obsługuje zakres głosu identyfikujący mówcę danego segmentu. Klient, sąd, nadawca lub projekt badawczy może wymagać innego stylu redakcyjnego.
Gdzie powinno pojawić się odniesienie czasowe w transkrypcji?
W ogólnej transkrypcji umieść znacznik czasu rozpoczęcia tury bezpośrednio przed etykietą mówcy. Używaj przedziałów od początku do końca, gdy redaktor potrzebuje dokładnych granic, znaczników okresowych tylko wtedy, gdy wymaga ich projekt, oraz przedziałów segmentów w przypadku napisów. Czasy na poziomie słów najlepiej przechowywać jako dane o wyrównaniu odczytywane maszynowo, zamiast drukować je przed każdym słowem.
Jak oznaczać nakładających się lub nieznanych mówców?
Zachowaj obie tury, gdy słowa są zrozumiałe, i przypisz każdej przedział czasowy. Dodaj spójny znacznik warunku, taki jak [nakładające się wypowiedzi], gdy pomaga on osobie weryfikującej. Jeśli głosu lub słów nie można zweryfikować, użyj Nieznany mówca lub [niezrozumiałe 00:24], zamiast przypisywać prawdopodobne imię i nazwisko albo wymyślać tekst.
Co HiNoter robi z etykietami mówców i znacznikami czasu?
Po autoryzacji HiNoter można ocenić pod kątem nawigacji po transkrypcji, edycji etykiet mówców, uporządkowanych notatek, czynności oraz odpowiedzi AI Chat powracających do znaczników czasu w źródle. Te funkcje produktu zostały podane przez użytkownika na potrzeby tego artykułu i przed publikacją muszą zostać zweryfikowane w bieżącym produkcie, planie, ustawieniach prywatności oraz procesie pracy z linkami do źródeł.
Porównaj autoryzowaną transkrypcję ze źródłem
Najpierw przejrzyj powyższy kontrolowany przykład. Następnie przetwórz jedno autoryzowane spotkanie lub plik w HiNoter, popraw etykiety mówców, otwórz znaczniki czasu źródła i potwierdź, że podsumowanie, czynności oraz odpowiedzi AI Chat zawierają poprawne przypisanie wypowiedzi.
Przetwórz autoryzowane spotkanie lub plik | Wyświetl AI Chat z linkami do źródeł