Skip to main content
HiNoter
Kotiin/Audio Transcript/Tekoälypohjaisen litteroinnin vertailumenetelmä: reilu testi
Audio TranscriptSep 14, 202611 min read

Tekoälypohjaisen litteroinnin vertailumenetelmä: reilu testi

Laboratoriotyylinen protokolla aineiston yhdenmukaisuudelle, ihmisen tarkistamalle totuudelle, WER:lle, entiteeteille, puhujatunnisteille ja korjaustyölle.

Kirjoittanut HiNoter Reproducibility Bench · Tarkistettu kokeellisen suunnittelun ja litterointimittareiden katselmointia varten · Testin ja näytön tila: menetelmä julkaistu; tuotteen toiminta vaatii käytännön varmennuksen · Julkaistu ja päivitetty 2026-09-02

Reilu litteroinnin vertailutesti antaa jokaiselle työkalulle saman valtuutetun äänitteen, mahdollisuuden asetusten määrittämiseen, tulosten määräajan ja pisteytyssäännöt. Säilytä ihmisen tarkistama totuuslitteraatti; ilmoita sanavirheprosentti nimien, numeroiden, terminologian, puhujien tunnistamisen, poisjääntien ja korjausajan rinnalla; ja julkaise kieli, aksentti, laite, melu, osallistujamäärä, kesto ja normalisointikäytäntö. Älä yhdistä keskenään vertailukelvottomia toimittajien tarkkuusväitteitä tai aseta paremmuusjärjestykseen työkaluja, joita on testattu eri tiedostoilla. Vertailutestin pitäisi vastata siihen, mikä työkalu toimii sinun kokousolosuhteissasi, ei siihen, mikä työkalu voittaa yleisesti. Käytä ”AI transcription benchmark method” -menetelmälle tätä toimintaperiaatetta: lukitse yksi edustava testiaineisto ja rekisteröi pisteytys-, normalisointi-, poissulkemis-, määritys-, uusinta- ja tasatulosten ratkaisemista koskevat säännöt etukäteen ennen minkään ehdokkaan käsittelyä.

AI-litteroinnin vertailumenetelmä, alkuperäinen tarkkuusinstrumenttia kuvaava laboratorioteknologian kuvitus, joka näyttää ydinkysymyksen ja päätöksentekoympäristön
Alkuperäinen paikallisesti renderöity tarkkuusinstrumenttia kuvaava laboratorioteknologian kuvitus, joka näyttää tämän toistettavan vertailuprotokollan ydinkysymyksen ja päätöksentekoympäristön; se ei ole HiNoter-käyttöliittymä tai tuotetesti.

Vertailutestistä tulee reilu, kun menetelmä on lukittu ennen kuin kukaan tietää, mikä työkalu hyötyy siitä. Harkitse tätä toimittajan luomaa, ei-asiakastapausta: hankintatiimi vertaa yhden toimittajan puhdasta englanninkielistä demoa toisen toimittajan meluiseen monikieliseen puheluun ja julkaisee harhaanjohtavan paremmuustaulukon. Sen tarkoitus on tehdä kysymyksestä ”Mikä on reilu tapa vertailla litterointityökaluja?” testattava ilman, että osallistuja, työntekijä, potilas, asiakas tai luottamuksellinen kokous paljastuu.

Tämä toistettava vertailuprotokolla on kirjoitettu ostajille, tutkijoille, toimittajille ja operatiivisille tiimeille, jotka vertailevat litterointityökaluja antamatta eri äänitteiden, asetusten tai pisteytyssääntöjen ratkaista voittajaa. Se erottaa ensikäden dokumentaation, havaitun testikäyttäytymisen, ihmisen tarkistaman lähdenäytön ja toimituksellisen harkinnan. Dokumentaatio ei koskaan korvaa käytännön tilitestiä, ja puuttuva tieto pysyy muodossa N/A.

Hallitsematon riski on täsmällinen: Kun jokainen työkalu saa erilaisen äänitteen tai erilaista muokkausapua, paremmuusjärjestys mittaa testin suunnittelua eikä litteroinnin laatua. Siksi menetelmä noudattaa tätä standardia: lukitse yksi edustava testiaineisto ja rekisteröi pisteytys-, normalisointi-, poissulkemis-, määritys-, uusinta- ja tasatulosten ratkaisemista koskevat säännöt etukäteen ennen minkään ehdokkaan käsittelyä. Tulos koskee vain ilmoitettuja kieliä, puhujia, äänipolkua, asetuksia, päivämäärää ja tarkistuskynnystä.

Reilu tekoälylitteroinnin vertailumenetelmä alkaa päätöksestä

Aineiston on edustettava sitä ääntä ja niitä seurauksia, joita ostaja todellisuudessa kohtaa.

Näyttö ensin: käytä ”Normalisointia” hyväksymiskriteerinä. Hyväksytty tulos tarkoittaa, että kirjainkoko, välimerkit, numerot ja täytesanat noudattavat kirjallisia sääntöjä; epäonnistumisen raja on se, että pisteytys suosii yhtä tulostusmuotoa. Lukitse aineisto ja pisteytyssäännöt ennen ensimmäisen ehdokkaan käsittelyä.

Sovella sääntöä tilanteeseen: uutistoimitus ja myyntitiimi valitsevat erilaiset kriittiset sanat, vaikka molemmat käyttävät WER:iä. Tämä muistuttaa ”Yhden henkilön sanelu” -tapausta, jossa näytön kohteena ovat sana- ja entiteettitarkkuus ja ihmisen tarkistusraja on pelkkä yksinkertainen perustaso. Tässä toistettavassa vertailuprotokollassa tarkoitus ei ole saada tulosta näyttämään vähemmän kyvykkäältä; tarkoitus on tunnistaa täsmällinen olosuhde, jossa kollega voi toistaa väitteen.

Päätös: kirjoita käyttötapaukset ja virheiden kustannukset ennen leikkeiden valintaa. Testilomakkeelle tallennetaan näytetunnus, ääniolosuhteet, totuusversion tunniste, työkalun asetukset, raakatuotoksen tiiviste, kaikki pisteet, korjausaika, poissulkemiset ja uusinnan syy. Jos lähdeketju päättyy, johtopäätös rajautuu; jos reitti epäonnistuu, rajaa päätös testattuihin olosuhteisiin, aja kiistanalaiset tapaukset uudelleen sokkoutetusti ja käytä ennen ostamista pilottia, jossa on ihmisen tekemät korjauslokit.

AI-litteroinnin vertailumenetelmä, alkuperäinen tarkkuusinstrumenttia kuvaava laboratorioteknologian kuvitus, joka näyttää signaalin tai kielen yksityiskohdan
Alkuperäinen paikallisesti renderöity tarkkuusinstrumenttia kuvaava laboratorioteknologian kuvitus, joka näyttää tämän toistettavan vertailuprotokollan signaalin tai kielen yksityiskohdan; se ei ole HiNoter-käyttöliittymä tai tuotetesti.

Toistettavan vertailuprotokollan näyttöä koskeva huomautus: Tutustu NIST — Speech Recognition Scoring Toolkit -työkaluun ennen kuin tukeudut siihen liittyvään standardiin, ominaisuuteen tai menetelmään.

Suorita toistettava litteroinnin vertailutesti

Raportoi tuloskortti

Julkaise WER, entiteetti- ja puhujatulokset, merkittävät virheet, korjausaika, kattavuus, epäonnistumiset, perustellut luottamusvälit ja rajoitukset. Päätä hyväksymiseen, rajaukseen, uudelleentestaukseen tai hylkäämiseen; jos ensisijainen reitti epäonnistuu, rajaa päätös testattuihin olosuhteisiin, aja kiistanalaiset tapaukset uudelleen sokkoutetusti ja käytä ennen ostamista pilottia, jossa on ihmisen tekemät korjauslokit.

Käsittele ehdokkaat yhdenmukaisesti

Käsittele samat tiedostot dokumentoiduilla asetuksilla ja säilytä raakatuotokset ilman hiljaista siistimistä. Merkitse puuttuva näyttö muodossa N/A ja erota havaittu käyttäytyminen dokumentaatiosta ja toimituksellisesta harkinnasta.

Lukitse protokolla

Määritä normalisointi, välimerkit, määritys, uudelleenyritykset, aikarajat, pisteytysskriptit ja poissulkemissäännöt ennen tulosten tarkastelua. Vertaa kirjalliseen odotukseen tai ihmisen tarkistamaan totuuteen äläkä sujuvuuteen, visuaaliseen viimeistelyyn tai selittämättömään pisteeseen.

Luo ihmisen tuottama totuus

Pyydä koulutettuja tarkistajia litteroimaan, merkitsemään puhujat, merkitsemään entiteetit, ratkaisemaan erimielisyydet ja säilyttämään versioitu viiteaineisto. Käytä valtuutettua, ei-arkaluonteista materiaalia ja säilytä havainnon toistamiseen tarvittava lähde.

Kokoa aineisto

Käytä valtuutettuja edustavia leikkeitä, jotka kattavat laitteet, tilat, puhujat, aksentit, melun, päällekkäisen puheen ja kriittisen sanaston. Dokumentoi kieli, alue, puhujat, laite, tila, melu, kesto, määritys, päivämäärä, malli- tai tuoteversio ja tarkistaja silloin, kun ne vaikuttavat johtopäätökseen.

Määritä päätös

Kirjoita kokoustyypit, kielet, virheiden kustannukset, tarkistusbudjetti ja tuotepäätös, jota vertailutestin on tuettava. Rajaa testi tämän synteettisen tapauksen avulla: hankintatiimi vertaa yhden toimittajan puhdasta englanninkielistä demoa toisen toimittajan meluiseen monikieliseen puheluun ja julkaisee harhaanjohtavan paremmuustaulukon.

Aineisto on instrumentti, ei soittolista

Kattavuuden tulisi olla harkittu kielen, laitteen, melun, päällekkäisen puheen, etäisyyden ja osallistujamäärän osalta.

Käsittele väitettä ”Aineisto on instrumentti, ei soittolista” toimintavalintana. Väite on hyödyllinen vain, kun ihmisen korjausaika mitataan sokkoutetusti. Jos paremmuusjärjestys sivuuttaa operatiivisen työmäärän, lopeta tuntemattoman tai ristiriidan muuttaminen suotuisaksi pisteeksi.

Vastaesimerkki on konkreettinen: Kymmenen helppoa leikettä ei voi edustaa ostosta ohjaavaa työpajatallennetta. ”Monikielisen asiakaspuhelun” työnkulussa keskity kielenvaihtoon ja nimiin ja pidä tulokset kielen mukaan eriteltyinä tarkistussääntönä. Tätä toistettavaa vertailuprotokollaa arvioitaessa säilytä riittävästi lähdekontekstia, jotta voit erottaa tunnistusvirheen, kielivirheen, puhujavirheen, yhteenvedon päätelmän, käännöksen merkityksen siirtymisen ja toimituksellisen uudelleenkirjoituksen.

Seuraava toimenpide on ehtomatriisin rakentaminen ja jokaisen vaaditun solun täyttäminen. Säilytä tätä toistettavaa vertailuprotokollaa varten vain valtuutettu näyttö, ilmoita olosuhteet ja nimeä henkilö, joka voi hyväksyä, korjata tai hylätä tuloksen. Testilomakkeelle tallennetaan näytetunnus, ääniolosuhteet, totuusversion tunniste, työkalun asetukset, raakatuotoksen tiiviste, kaikki pisteet, korjausaika, poissulkemiset ja uusinnan syy.

Toistettavan vertailuprotokollan näyttöä koskeva huomautus: Tutustu NIST — AI Risk Management Framework -viitekehykseen ennen kuin tukeudut siihen liittyvään standardiin, ominaisuuteen tai menetelmään.

Ihmisen tuottama totuus tarvitsee oman laadunvalvontansa

Viiteteksti on todiste vain silloin, kun käytännöt ja erimielisyydet on dokumentoitu.

Kysy, mikä näyttö muuttaisi päätöksen. ”Normalisoinnin” osalta vaadittu havainto on, että kirjainkoot, välimerkit, numerot ja täytesanat noudattavat kirjallisia sääntöjä. Sujuva käyttöliittymä, korkealta näyttävä pistemäärä tai pitkä kielilista eivät voi korjata epäonnistumista ”pisteytys suosii yhtä tulostemuotoa”.

Käytä esimerkkiä pienoistestinä: Kaksi arvioijaa on eri mieltä päällekkäisestä tuotekoodista ja lähettää sen ratkaistavaksi. Lue se kohdan ”Yhden henkilön sanelu” rinnalla: käytännön huolenaihe on sanojen ja entiteettien tarkkuus, kun taas yksinkertainen lähtötaso pitää henkilön vain auktoriteettiketjun sisällä. Tuntemattoman toistettavan vertailuprotokollan toiminta pysyy tilassa N/A, kunnes se havaitaan.

Versioi viite ja säilytä ratkaisuun liittyvät muistiinpanot ennen julkaisemista tai ostamista. Tämän toistettavan vertailuprotokollan testin yhteydessä tallenna syöte, asetukset, lähde, tuloste, korjaus ja arvioija siinä vaiheessa, jossa niillä on merkitystä. Jos automatisoitu polku ei pysty säilyttämään näyttöä, rajaa päätös testattuihin olosuhteisiin, suorita kiistanalaiset tapaukset uudelleen sokkoutetusti ja käytä pilottia, jossa ihmisten korjauslokit kerätään, ennen ostamista.

Toistettavan vertailuprotokollan näyttöhuomautus: Tutustu Yhdysvaltain liittovaltion kauppakomission julkaisuun — Pidä tekoälyväitteesi kurissa ennen kuin luotat siihen liittyvään standardiin, ominaisuuteen tai menetelmään.

Jatka tutustumalla äänitranskriptiomenetelmiintekoälyteknologian arviointeihin tai tekoälykäännösten työnkulkuihin.

Esirekisteröi pisteytys ennen voittajien näkemistä

Normalisointivalinnat voivat muuttaa sijoituksia, eikä niitä saa säätää tulosten ilmestymisen jälkeen.

Tämä osio toimii porttina eikä ominaisuusluettelona. Portti on ”Korjauskustannus”: hyväksy vain, jos ihmisen tekemään korjaukseen kuluva aika mitataan sokkoutetusti, ja hylkää olennaisesti silloin, kun sijoitus ei huomioi operatiivista työmäärää. Tämä kehystys pitää tekoälyn transkription vertailumenetelmän sidottuna todelliseen päätökseen.

Käy operatiivinen tapaus läpi: Yksi tuloste kirjoittaa ”kaksikymmentäyksi”, kun taas toinen kirjoittaa ”21” ilmoittamattoman käytännön mukaisesti. Vertailukelpoinen esimerkki on ”Monikielinen asiakaspuhelu”, jossa kielenvaihto ja nimet asetetaan yleisen sujuvuuden edelle ja eskalointia varten käytetään kielen mukaan jaettuja tuloksia. Rajattu testi voidaan toistaa; laajaa lupausta ei.

Sulje portti päättämällä, että skriptit, asetukset, uudelleenajot, poissulkemiset ja tasapelisäännöt jäädytetään. Vertailulomakkeelle tallennetaan otoksen tunnus, ääniolosuhteet, totuuden versio, työkalun asetukset, raakatuotoksen tiiviste, jokainen pistemäärä, korjausaika, poissulkemiset ja uudelleenajon syy. Julkaise jäljelle jäävät poissulkemiset ja ohjaa kiistanalainen tai merkityksellinen sisältö tämän varamenettelyn kautta: rajaa päätös testattuihin olosuhteisiin, suorita kiistanalaiset tapaukset uudelleen sokkoutetusti ja käytä pilottia, jossa ihmisten korjauslokit kerätään, ennen ostamista.

HyväksymiskohtaHyväksyttävä näyttöOlennainen epäonnistuminen
Aineiston vastaavuusjokainen ehdokas saa täsmälleen samat lähdetiedostothelpot ja vaikeat otokset jaetaan epätasaisesti
Totuudenmukainen viiteihmisten erimielisyydet ratkaistaan ja versioidaanyhdestä tarkistamattomasta transkriptiosta tulee vastausavain
Normalisointikirjainkoot, välimerkit, numerot ja täytesanat noudattavat kirjallisia sääntöjäpisteytys suosii yhtä tulostemuotoa
Kriittiset entiteetitnimet, numerot, termit ja negaatio saavat erilliset pisteetkoostettu WER peittää kalliit epäonnistumiset
Puhujien käsittelyattribuutio ja päällekkäisyys pisteytetään silloin, kun sillä on merkitystäoikeat sanat väärillä puhujilla hyväksytään
Korjauskustannusihmisen tekemään korjaukseen kuluva aika mitataan sokkoutetustisijoitus ei huomioi operatiivista työmäärää
Tekoälyn transkription vertailumenetelmästä kertova alkuperäinen tarkkuusinstrumenttia ja laboratorioteknologiaa esittävä kuvitus, joka näyttää testimenetelmän
Alkuperäinen paikallisesti renderöity tarkkuusinstrumenttia ja laboratorioteknologiaa esittävä kuvitus, joka näyttää tämän toistettavan vertailuprotokollan testimenetelmän; se ei ole HiNoter-käyttöliittymä tai tuotetesti.

Toistettavan vertailuprotokollan näyttöhuomautus: Tutustu Google Cloudin Cloud Speech-to-Text -dokumentaatioon ennen kuin luotat siihen liittyvään standardiin, ominaisuuteen tai menetelmään.

WER on lähtötaso, ei liiketoimintaa koskeva tuomio

Koostettu muokkausetäisyys kohtelee monia harmittomia ja merkityksellisiä virheitä samalla tavalla.

Näyttö ensin: käytä ”Normalisointia” hyväksymiskohtana. Hyväksytty tulos tarkoittaa, että kirjainkoot, välimerkit, numerot ja täytesanat noudattavat kirjallisia sääntöjä; epäonnistumisen raja on, että pisteytys suosii yhtä tulostemuotoa. Jäädytä aineisto ja pisteytyssäännöt ennen ensimmäisen ehdokkaan käsittelyä.

Sovella sääntöä tilanteeseen: Työkalu voittaa WER:n, vaikka se vaihtaa tilinomistajan kahdessa kriittisessä puhelussa. Tämä muistuttaa tapausta ”Yhden henkilön sanelu”, jossa näytön kohteena ovat sanojen ja entiteettien tarkkuus ja ihmisen asettama raja on pelkkä lähtötaso. Tämän toistettavan vertailuprotokollan tarkoitus ei ole saada tulostetta vaikuttamaan vähemmän kyvykkäältä, vaan tunnistaa täsmällinen ehto, jonka vallitessa työtoveri voi toistaa väitteen.

Päätös: lisää entiteettien, negaation, attribuution, poisjättämisen ja olennaisten virheiden pisteet. Vertailulomakkeelle tallennetaan otoksen tunnus, ääniolosuhteet, totuuden versio, työkalun asetukset, raakatuotoksen tiiviste, jokainen pistemäärä, korjausaika, poissulkemiset ja uudelleenajon syy. Jos lähdeketju katkeaa, johtopäätös rajautuu; jos reitti epäonnistuu, rajaa päätös testattuihin olosuhteisiin, suorita kiistanalaiset tapaukset uudelleen sokkoutetusti ja käytä pilottia, jossa ihmisten korjauslokit kerätään, ennen ostamista.

Tekoälyn transkription vertailumenetelmä, alkuperäinen paikallisesti renderöity tarkkuusinstrumentin laboratorioteknologian kuvitus, joka näyttää epäonnistumisen rajan
Alkuperäinen paikallisesti renderöity tarkkuusinstrumentin laboratorioteknologian kuvitus, joka näyttää tämän toistettavan vertailuprotokollan epäonnistumisen rajan; se ei ole HiNoter-käyttöliittymä tai tuotetesti.

Toistettavan vertailuprotokollan näyttöhuomautus: Tutustu Microsoft Learn — Puhe tekstiksi -dokumentaatioon ennen kuin tukeudut asiaankuuluvaan standardiin, ominaisuuteen tai menetelmään.

Korjausaika muuttaa tarkkuuden käyttökustannukseksi

Paras raakatekstitys voi silti olla hitaampi korjata, jos virheitä on vaikea löytää.

Käsittele väitettä ”Korjausaika muuttaa tarkkuuden käyttökustannukseksi” toimintaa koskevana valintana. Väite on hyödyllinen vain, kun ihmisen käyttämä korjausaika mitataan sokkona. Jos järjestys jättää operatiivisen työmäärän huomiotta, lopeta tuntemattoman tai ristiriidan muuttaminen suotuisaksi pistemääräksi.

Vastaesimerkki on konkreettinen: Arvioijat mittaavat saman sokkona tehtävän korjaustehtävän ajan ja kirjaavat haun, toiston ja uudelleenmerkitsemisen vaatiman työn. ”Monikielinen asiakaspuhelu” -työnkulussa keskity kielen vaihtumiseen ja nimiin ja pidä tulokset kielittäin eriteltyinä tarkistussääntönä. Tätä toistettavaa vertailuprotokollaa tarkistettaessa säilytä riittävästi lähdekontekstia, jotta tunnistusvirhe, kielivirhe, puhujavirhe, yhteenvedon päättely, käännöksen ajautuminen tai toimituksellinen uudelleenkirjoitus voidaan erottaa toisistaan.

Seuraava toimenpide on mitata korjausajan mediaani ja merkitä virheen tyyppi. Tätä toistettavaa vertailuprotokollaa varten tallenna vain valtuutettu näyttö, ilmoita olosuhteet ja nimeä henkilö, joka voi hyväksyä, korjata tai hylätä tuloksen. Vertailulomakkeelle tallennetaan näytetunnus, ääniolosuhteet, totuusversion versio, työkalun asetukset, raakatulosteen tiiviste, kaikki pisteet, korjausaika, poissulkemiset ja uudelleenajon syy.

Toistettavan vertailuprotokollan näyttöhuomautus: Tutustu Amazon Web Services — Amazon Transcribe -kehittäjän oppaaseen ennen kuin tukeudut asiaankuuluvaan standardiin, ominaisuuteen tai menetelmään.

Laita HiNoter samalle testipenkille: Käytä yhtä valtuutettua, arkaluonteetonta näytettä ja arvioi nykyinen HiNoter-työnkulku vain varmennetun toiminnan puitteissa.

Laita HiNoter samalle testipenkille

HiNoterin tulisi saada sama aineisto, sallitut asetukset, aikajakso ja pisteytyskoodi.

Kysy, mikä näyttö muuttaisi päätöstä. ”Normalisoinnin” osalta vaadittu havainto on, että kirjainkoko, välimerkit, numerot ja täytesanat noudattavat kirjallisia sääntöjä. Sujuva käyttöliittymä, korkealta näyttävä pistemäärä tai pitkä kieliluettelo ei voi korjata epäonnistumista ”pisteytys suosii yhtä tulostusmuotoa”.

Käytä esimerkkiä pienoistestinä: Raakatulos, havaittu kielen käyttäytyminen, yhteenvedon jäljitettävyys ja korjaamiseen käytetty työ kirjataan ilman yleispätevää tarkkuusväitettä. Lue se ”Yhden henkilön sanelun” rinnalla: käytännön huolenaiheena on sanojen ja entiteettien tarkkuus, kun taas yksinkertainen perustaso pitää henkilön vain päätösvaltaketjussa. Tuntematon toistettavan vertailuprotokollan toiminta on edelleen N/A, kunnes se on havaittu.

Ennen julkaisemista tai ostamista merkitse N/A kaikille ominaisuuksille tai kielille, joita ei ole tosiasiassa testattu. Tätä toistettavaa vertailuprotokollatestiä varten kirjaa syöte, asetukset, lähde, tulos, korjaus ja arvioija siinä vaiheessa, jossa niillä on merkitystä. Jos automatisoitu polku ei pysty säilyttämään näyttöä, rajaa päätös testattuihin olosuhteisiin, aja kiistanalaiset tapaukset uudelleen sokkona ja käytä ihmisen korjauslokeilla varustettua pilottia ennen ostamista.

Toistettavan vertailuprotokollan näyttöhuomautus: Tutustu HiNoter — HiNoter-tuotesivustoon ennen kuin tukeudut asiaankuuluvaan standardiin, ominaisuuteen tai menetelmään.

Toistettava raportti osoittaa, missä järjestys päättyy

Lukijat tarvitsevat olosuhteet, näytemäärät, päivämäärät, poissulkemiset ja epävarmuuden ennen kuin soveltavat tuloksia muualla.

Tämä osio toimii porttina eikä ominaisuusluettelona. Portti on ”Korjauskustannus”: läpäise vain, jos ihmisen korjausaika mitataan sokkona, ja epäonnistu olennaisesti, jos järjestys jättää operatiivisen työmäärän huomiotta. Tämä kehystys pitää tekoälyn transkription vertailumenetelmän sidottuna todelliseen päätökseen.

Käy operatiivinen tapaus läpi: Lopullisessa tulostaulukossa todetaan, etteivät johtopäätökset kata uusia kieliä, puhelinääntä tai tulevia malliversioita. Vertailukelpoinen malli on ”Monikielinen asiakaspuhelu”, jossa kielen vaihtuminen ja nimet asetetaan yleisen sujuvuuden edelle ja tulokset eritellään kielittäin eskalointia varten. Rajattu testi voidaan toistaa; laajaa lupausta ei voida.

Sulje portti päättämällä arkistoida syötteet, tiivisteet, tulosteet, skriptit ja raportin versio. Vertailulomakkeelle tallennetaan näytetunnus, ääniolosuhteet, totuusversion versio, työkalun asetukset, raakatulosteen tiiviste, kaikki pisteet, korjausaika, poissulkemiset ja uudelleenajon syy. Julkaise jäljelle jäävät poissulkemiset ja ohjaa kiistanalainen tai merkityksellinen sisältö tämän varamenettelyn kautta: rajaa päätös testattuihin olosuhteisiin, aja kiistanalaiset tapaukset uudelleen sokkona ja käytä ihmisen korjauslokeilla varustettua pilottia ennen ostamista.

Kokous tai testitapausNäytön tavoiteIhmisen raja
Yhden henkilön sanelusanojen ja entiteettien tarkkuusvain yksinkertainen perustaso
Hybridi­työryhmän kokouskanavat, puhujat ja päällekkäisyysmääritä pisteiden kohdistus erikseen
Monikielinen asiakaspuhelukielen vaihtuminen ja nimeterittele tulokset kielittäin
Merkityksellinen tarkistuspäätökset ja lainauksetsovella olennaisen virheen portteja
Tekoälyn transkription vertailumenetelmä, alkuperäinen paikallisesti renderöity tarkkuusinstrumentin laboratorioteknologian kuvitus, joka näyttää tarkistus- ja palautumispäätöksen
Alkuperäinen paikallisesti renderöity tarkkuusinstrumentin laboratorioteknologian kuvitus, joka näyttää tämän toistettavan vertailuprotokollan tarkistus- ja palautumispäätöksen; se ei ole HiNoter-käyttöliittymä tai tuotetesti.

Toistettavan vertailuprotokollan evidenssihuomautus: Tutustu NIST — Speech Recognition Scoring Toolkit -työkaluun ennen kuin tukeudut siihen liittyvään standardiin, ominaisuuteen tai menetelmään.

Kysymyksiä toistettavasta vertailuprotokollasta

Mikä on reilu tapa vertailla litterointityökaluja?

Reilussa litteroinnin vertailussa jokaiselle työkalulle annetaan sama asianmukaisesti luvitettu ääniaineisto, mahdollisuus määritysten tekemiseen, toimitusaika ja pisteytyssäännöt. Säilytä ihmisen tarkistama totuudenmukainen litteraatti; ilmoita sanavirheprosentti sekä nimet, numerot, terminologia, puhujien tunnistaminen, poisjätöt ja korjausaika; ja julkaise kieli, aksentti, laite, melu, osallistujamäärä, kesto ja normalisointikäytäntö. Älä yhdistä keskenään vertailukelvottomia toimittajien tarkkuusväitteitä tai aseta eri tiedostoilla testattuja työkaluja paremmuusjärjestykseen. Vertailun pitäisi vastata siihen, mikä työkalu toimii kokousolosuhteissasi, ei siihen, mikä työkalu voittaa yleisesti. Sovella johtopäätöstä vain niihin kieliin, kielimuotoihin, ääniolosuhteisiin, puhujiin, määrityksiin, tulostusvaiheisiin ja tarkistussääntöihin, joita todella testattiin.

Mitä minun pitäisi tarkistaa ensin tekoälyn litteroinnin vertailumenetelmää varten?

Aloita tästä rajauksesta: jäädytä yksi edustava testikorpus ja rekisteröi pisteytys-, normalisointi-, poissulkemis-, määritys-, uudelleenajo- ja tasatuloksen ratkaisemista koskevat säännöt etukäteen ennen minkään ehdokkaan käsittelyä. Säilytä lähde ja määrittele merkitykselliset sanat tai väitteet ennen viimeistellyn tulosteen tarkastelemista.

Onko sujuva litteraatti, yhteenveto tai käännös tarkka?

Ei välttämättä. Sujuvuus mittaa luettavuutta, kun taas uskollisuus kysyy, vastaavatko nimet, numerot, kielto, puhujat, olosuhteet, päätökset, terminologia ja sävy lähdettä. Tarkista nämä kohdat suoraan.

Miten monikieliset näytteet pitäisi testata?

Käytä äidinkielisiä puhujia, kielialueella merkittyjä totuudenmukaisia litteraatteja, edustavia laitteita ja tiloja sekä erillisiä tuloksia kullekin kielelle tai alueelliselle kielimuodolle. Merkitse jokainen kielenvaihdoskohta äläkä koskaan yhdistä pt-BR- ja pt-PT-tuloksia yhdeksi selittämättömäksi pistemääräksi.

Milloin ihmisen tekemä tarkistus on välttämätön?

Vaadi pätevän henkilön tarkistus merkityksellisiä päätöksiä, lainauksia, sitoumuksia, oikeudellisia tai henkilöstöön liittyviä asiakirjoja, tuntemattomia nimiä ja termejä, kiistanalaisia kohtia, heikkolaatuista ääntä sekä kaikkia tulosteita varten, joita ei voida jäljittää lähteeseen.

Miten HiNoteria pitäisi arvioida?

Suorita tästä tapauksesta asianmukaisesti luvitettu, arkaluonteeton versio: hankintatiimi vertailee yhden toimittajan selkeää englanninkielistä esittelyä toisen toimittajan meluiseen monikieliseen puheluun ja julkaisee harhaanjohtavan paremmuuslistan. Tarkista ajantasainen syöte, kieli, litteraatti, yhteenveto tai käännös, lähteessä navigointi, muokkaukset, vienti, käyttöoikeudet ja poistamiskäytännöt; merkitse kaikki testaamattomat kohdat arvolla N/A.

Päätöksenteon rajaus

Kysymykseen ”Mikä on reilu tapa vertailla litterointityökaluja?” puolusteltava vastaus on edelleen ehdollinen. Reilussa litteroinnin vertailussa jokaiselle työkalulle annetaan sama asianmukaisesti luvitettu ääniaineisto, mahdollisuus määritysten tekemiseen, toimitusaika ja pisteytyssäännöt. Säilytä ihmisen tarkistama totuudenmukainen litteraatti; ilmoita sanavirheprosentti sekä nimet, numerot, terminologia, puhujien tunnistaminen, poisjätöt ja korjausaika; ja julkaise kieli, aksentti, laite, melu, osallistujamäärä, kesto ja normalisointikäytäntö. Älä yhdistä keskenään vertailukelvottomia toimittajien tarkkuusväitteitä tai aseta eri tiedostoilla testattuja työkaluja paremmuusjärjestykseen. Vertailun pitäisi vastata siihen, mikä työkalu toimii kokousolosuhteissasi, ei siihen, mikä työkalu voittaa yleisesti. Puolusteltava voittaja on työkalu, joka suoriutuu parhaiten julkaistun päätöksenteon rajauksen sisällä — ei se, johon liittyy suurin selittämätön luku. Jos näyttö ei riitä tekoälyn litteroinnin vertailumenetelmää koskevan väitteen tueksi, julkaise sen sijaan ”ei varmennettu” tai N/A äläkä myönteistä arviota.

Suorita toistettava litteroinnin vertailu: Suorita yksi edustava näyte, vertaa tulostetta sen lähteeseen ja testaa HiNoteria vain niiden täsmällisten kielten ja työnkulun vaiheiden puitteissa, jotka varmennat.