Skip to main content
HiNoter
บ้าน/Audio Transcript/วิธีการทดสอบมาตรฐานการถอดเสียง AI: การทดสอบที่เป็นธรรม
Audio TranscriptSep 14, 20261 min read

วิธีการทดสอบมาตรฐานการถอดเสียง AI: การทดสอบที่เป็นธรรม

ระเบียบวิธีรูปแบบห้องปฏิบัติการสำหรับความเสมอภาคของคลังข้อมูล ค่าความจริงที่ตรวจสอบโดยมนุษย์ WER เอนทิตี ป้ายกำกับผู้พูด และความพยายามในการแก้ไข

เขียนโดย HiNoter Reproducibility Benchmark · ตรวจทานสำหรับการออกแบบการทดลองและเมตริกการถอดเสียง · สถานะการทดสอบและหลักฐาน: เผยแพร่วิธีการแล้ว; พฤติกรรมของผลิตภัณฑ์ต้องตรวจสอบแบบสด · เผยแพร่และอัปเดต 2026-09-02

การทดสอบมาตรฐานการถอดเสียงที่เป็นธรรมให้เครื่องมือทุกตัวได้รับเสียงที่ได้รับอนุญาต โอกาสในการกำหนดค่า กำหนดเวลาส่งออก และกฎการให้คะแนนแบบเดียวกัน เก็บรักษาข้อความถอดเสียงความจริงที่มนุษย์ตรวจสอบแล้ว รายงานอัตราความผิดพลาดของคำควบคู่กับชื่อ ตัวเลข คำศัพท์ การระบุผู้พูด การตกหล่น และเวลาที่ใช้แก้ไข และเผยแพร่ภาษา สำเนียง อุปกรณ์ เสียงรบกวน จำนวนผู้เข้าร่วม ระยะเวลา และนโยบายการปรับรูปแบบ อย่านำคำกล่าวอ้างด้านความแม่นยำของผู้ให้บริการที่เปรียบเทียบกันไม่ได้มารวมกัน หรือจัดอันดับเครื่องมือที่ทดสอบด้วยไฟล์คนละชุด การทดสอบมาตรฐานควรตอบว่าเครื่องมือใดทำงานได้กับสภาพการประชุมของคุณ ไม่ใช่เครื่องมือใดชนะในทุกกรณี สำหรับ ‘วิธีการทดสอบมาตรฐานการถอดเสียงด้วย AI’ ให้ใช้กฎการดำเนินงานนี้: ตรึงคลังข้อมูลทดสอบที่เป็นตัวแทนหนึ่งชุด และลงทะเบียนกฎการให้คะแนน การปรับรูปแบบ การยกเว้น การกำหนดค่า การทดสอบซ้ำ และการตัดสินกรณีเสมอไว้ล่วงหน้าก่อนประมวลผลผู้สมัครรายใด

ภาพประกอบเทคโนโลยีเครื่องมือความแม่นยำสูงในห้องปฏิบัติการต้นฉบับของวิธีการทดสอบมาตรฐานการถอดเสียงด้วย AI ซึ่งแสดงคำถามหลักและบริบทของการตัดสินใจ
ภาพประกอบเทคโนโลยีเครื่องมือความแม่นยำสูงในห้องปฏิบัติการต้นฉบับที่เรนเดอร์ภายในเครื่อง ซึ่งแสดงคำถามหลักและบริบทของการตัดสินใจสำหรับระเบียบวิธีการทดสอบมาตรฐานที่ทำซ้ำได้; ไม่ใช่อินเทอร์เฟซหรือการทดสอบผลิตภัณฑ์ของ HiNoter

การทดสอบมาตรฐานจะเป็นธรรมเมื่อกำหนดวิธีการไว้ก่อนที่ใครจะรู้ว่าเครื่องมือใดได้เปรียบ ลองพิจารณาสถานการณ์ที่สร้างขึ้นโดยบรรณาธิการและไม่ใช่กรณีของลูกค้านี้: ทีมจัดซื้อเปรียบเทียบเดโมภาษาอังกฤษที่เสียงชัดของผู้ให้บริการรายหนึ่งกับการโทรหลายภาษาที่มีเสียงรบกวนของผู้ให้บริการอีกราย แล้วเผยแพร่ตารางจัดอันดับที่ทำให้เข้าใจผิด สถานการณ์นี้มีขึ้นเพื่อทำให้คำถาม ‘วิธีที่เป็นธรรมในการทดสอบมาตรฐานเครื่องมือถอดเสียงคืออะไร?’ สามารถทดสอบได้โดยไม่เปิดเผยผู้เข้าร่วม พนักงาน ผู้ป่วย ลูกค้า หรือการประชุมที่เป็นความลับ

ระเบียบวิธีการทดสอบมาตรฐานที่ทำซ้ำได้นี้เขียนขึ้นสำหรับผู้ซื้อ นักวิจัย บรรณาธิการ และทีมปฏิบัติการที่เปรียบเทียบเครื่องมือถอดเสียง โดยไม่ปล่อยให้เสียง การตั้งค่า หรือกฎการให้คะแนนที่แตกต่างกันเป็นตัวตัดสินผู้ชนะ วิธีนี้แยกเอกสารจากผู้ให้บริการ หลักฐานพฤติกรรมที่สังเกตได้จากการทดสอบ แหล่งข้อมูลที่มนุษย์ตรวจสอบแล้ว และดุลยพินิจของบรรณาธิการ เอกสารไม่สามารถใช้แทนการทดสอบบัญชีแบบสดได้ และข้อเท็จจริงที่ไม่พร้อมใช้งานให้ระบุเป็น N/A

ความเสี่ยงหลักมีความเฉพาะเจาะจง: เมื่อเครื่องมือแต่ละตัวได้รับเสียงหรือความช่วยเหลือในการแก้ไขที่แตกต่างกัน การจัดอันดับจะวัดการออกแบบการทดสอบแทนคุณภาพการถอดเสียง ดังนั้นวิธีนี้จึงปฏิบัติตามมาตรฐานนี้: ตรึงคลังข้อมูลทดสอบที่เป็นตัวแทนหนึ่งชุด และลงทะเบียนกฎการให้คะแนน การปรับรูปแบบ การยกเว้น การกำหนดค่า การทดสอบซ้ำ และการตัดสินกรณีเสมอไว้ล่วงหน้าก่อนประมวลผลผู้สมัครรายใด ผลลัพธ์ใช้ได้เฉพาะกับภาษา ผู้พูด เส้นทางเสียง การตั้งค่า วันที่ และเกณฑ์การตรวจทานที่เปิดเผยไว้

วิธีการทดสอบมาตรฐานการถอดเสียงด้วย AI ที่เป็นธรรมเริ่มต้นจากการตัดสินใจ

คลังข้อมูลต้องเป็นตัวแทนของเสียงและผลกระทบที่ผู้ซื้อเผชิญจริง

เริ่มจากหลักฐาน: ใช้ ‘การปรับรูปแบบ’ เป็นรายการตรวจรับ การผ่านหมายความว่าตัวพิมพ์ใหญ่-เล็ก เครื่องหมายวรรคตอน ตัวเลข และคำเติมเต็มเป็นไปตามกฎที่เขียนไว้; ขอบเขตของความล้มเหลวคือการให้คะแนนเอื้อให้รูปแบบผลลัพธ์แบบหนึ่งได้เปรียบ ตรึงคลังข้อมูลและกฎการให้คะแนนก่อนประมวลผลผู้สมัครรายแรก

นำกฎไปใช้กับฉาก: ห้องข่าวและทีมขายเลือกคำสำคัญที่แตกต่างกัน แม้ทั้งคู่จะใช้ WER ก็ตาม สิ่งนี้คล้ายกับกรณี ‘การป้อนตามคำบอกโดยคนเดียว’ ซึ่งเป้าหมายของหลักฐานคือความแม่นยำของคำและเอนทิตี และขอบเขตของมนุษย์คือการใช้เพียงค่าพื้นฐานอย่างง่าย สำหรับระเบียบวิธีการทดสอบมาตรฐานที่ทำซ้ำได้นี้ ประเด็นไม่ใช่การทำให้ผลลัพธ์ดูมีความสามารถน้อยลง แต่คือการระบุเงื่อนไขที่แน่นอนซึ่งเพื่อนร่วมงานสามารถทำซ้ำข้อกล่าวอ้างนั้นได้

การตัดสินใจ: เขียนกรณีการใช้งานและต้นทุนของความล้มเหลวก่อนเลือกคลิป แบบฟอร์มการทดสอบเก็บรหัสตัวอย่าง เงื่อนไขเสียง เวอร์ชันความจริง การตั้งค่าเครื่องมือ แฮชผลลัพธ์ดิบ คะแนนทุกค่า เวลาแก้ไข การยกเว้น และเหตุผลในการทดสอบซ้ำ หากห่วงโซ่แหล่งที่มาสิ้นสุดลง ข้อสรุปต้องแคบลง; หากเส้นทางล้มเหลว ให้จำกัดการตัดสินใจไว้ที่เงื่อนไขที่ทดสอบ ทดสอบกรณีที่มีข้อโต้แย้งซ้ำแบบไม่เปิดเผยผลเดิม และใช้โครงการนำร่องพร้อมบันทึกการแก้ไขโดยมนุษย์ก่อนจัดซื้อ

ภาพประกอบเทคโนโลยีเครื่องมือความแม่นยำสูงในห้องปฏิบัติการต้นฉบับของวิธีการทดสอบมาตรฐานการถอดเสียงด้วย AI ซึ่งแสดงรายละเอียดของสัญญาณหรือภาษา
ภาพประกอบเทคโนโลยีเครื่องมือความแม่นยำสูงในห้องปฏิบัติการต้นฉบับที่เรนเดอร์ภายในเครื่อง ซึ่งแสดงรายละเอียดของสัญญาณหรือภาษาสำหรับระเบียบวิธีการทดสอบมาตรฐานที่ทำซ้ำได้นี้; ไม่ใช่อินเทอร์เฟซหรือการทดสอบผลิตภัณฑ์ของ HiNoter

หมายเหตุหลักฐานของระเบียบวิธีการทดสอบมาตรฐานที่ทำซ้ำได้: ตรวจทาน NIST — ชุดเครื่องมือการให้คะแนนการรู้จำเสียงพูด ก่อนอาศัยมาตรฐาน คุณลักษณะ หรือวิธีการที่เกี่ยวข้อง

ดำเนินการทดสอบมาตรฐานการถอดเสียงที่ทำซ้ำได้

รายงานตารางคะแนน

เผยแพร่ผลลัพธ์ WER ผลลัพธ์ด้านเอนทิตีและผู้พูด ข้อผิดพลาดที่มีสาระสำคัญ เวลาแก้ไข ความครอบคลุม ความล้มเหลว ช่วงความเชื่อมั่นเมื่อมีเหตุผลเพียงพอ และข้อจำกัด ปิดท้ายด้วยอนุมัติ จำกัดขอบเขต ทดสอบซ้ำ หรือปฏิเสธ; หากเส้นทางหลักล้มเหลว ให้จำกัดการตัดสินใจไว้ที่เงื่อนไขที่ทดสอบ ทดสอบกรณีที่มีข้อโต้แย้งซ้ำแบบไม่เปิดเผยผลเดิม และใช้โครงการนำร่องพร้อมบันทึกการแก้ไขโดยมนุษย์ก่อนจัดซื้อ

ดำเนินการกับผู้สมัครอย่างสม่ำเสมอ

ประมวลผลไฟล์เดียวกันภายใต้การตั้งค่าที่จัดทำเป็นเอกสาร และเก็บรักษาผลลัพธ์ดิบโดยไม่ทำความสะอาดอย่างเงียบ ๆ บันทึกหลักฐานที่ขาดหายเป็น N/A และแยกพฤติกรรมที่สังเกตได้ออกจากเอกสารและดุลยพินิจของบรรณาธิการ

ตรึงระเบียบวิธี

กำหนดการปรับรูปแบบ เครื่องหมายวรรคตอน การกำหนดค่า การลองใหม่ ขีดจำกัดเวลา สคริปต์การให้คะแนน และกฎการยกเว้นก่อนดูผลลัพธ์ เปรียบเทียบกับความคาดหวังที่เขียนไว้หรือความจริงที่มนุษย์ตรวจสอบแล้ว แทนที่จะเปรียบเทียบกับความลื่นไหล ความสวยงามทางภาพ หรือคะแนนที่ไม่มีคำอธิบาย

สร้างความจริงโดยมนุษย์

ให้ผู้ตรวจทานที่ผ่านการฝึกอบรมถอดเสียง ระบุป้ายกำกับผู้พูด ทำเครื่องหมายเอนทิตี แก้ไขความไม่ตรงกัน และเก็บรักษาข้อมูลอ้างอิงที่มีการจัดการเวอร์ชัน ใช้เนื้อหาที่ได้รับอนุญาตและไม่อ่อนไหว และเก็บรักษาแหล่งข้อมูลที่จำเป็นต่อการทำซ้ำข้อสังเกต

ประกอบคลังข้อมูล

ใช้คลิปตัวแทนที่ได้รับอนุญาต ซึ่งครอบคลุมอุปกรณ์ ห้อง ผู้พูด สำเนียง เสียงรบกวน การพูดทับซ้อน และคำศัพท์สำคัญ จัดทำเอกสารเกี่ยวกับภาษา ภูมิภาค ผู้พูด อุปกรณ์ ห้อง เสียงรบกวน ระยะเวลา การกำหนดค่า วันที่ เวอร์ชันโมเดลหรือผลิตภัณฑ์ และผู้ตรวจทาน เมื่อสิ่งเหล่านี้มีผลต่อข้อสรุป

กำหนดการตัดสินใจ

เขียนประเภทการประชุม ภาษา ต้นทุนของความล้มเหลว งบประมาณการตรวจทาน และการตัดสินใจเกี่ยวกับผลิตภัณฑ์ที่การทดสอบมาตรฐานต้องสนับสนุน กำหนดขอบเขตการทดสอบด้วยกรณีสังเคราะห์นี้: ทีมจัดซื้อเปรียบเทียบเดโมภาษาอังกฤษที่เสียงชัดของผู้ให้บริการรายหนึ่งกับการโทรหลายภาษาที่มีเสียงรบกวนของผู้ให้บริการอีกราย แล้วเผยแพร่ตารางจัดอันดับที่ทำให้เข้าใจผิด

คลังข้อมูลคือเครื่องมือ ไม่ใช่เพลย์ลิสต์

ความครอบคลุมควรได้รับการกำหนดอย่างตั้งใจในด้านภาษา อุปกรณ์ เสียงรบกวน การพูดทับซ้อน ระยะห่าง และจำนวนผู้เข้าร่วม

ถือว่า ‘คลังข้อมูลคือเครื่องมือ ไม่ใช่เพลย์ลิสต์’ เป็นทางเลือกในการดำเนินงาน ข้อกล่าวอ้างนี้มีประโยชน์ก็ต่อเมื่อวัดเวลาแก้ไขโดยมนุษย์แบบไม่เปิดเผยผลเดิม หากการจัดอันดับไม่คำนึงถึงภาระงานในการดำเนินงาน ให้หยุดเปลี่ยนสิ่งที่ไม่ทราบหรือข้อขัดแย้งให้กลายเป็นคะแนนที่เอื้อประโยชน์

ตัวอย่างโต้แย้งเป็นรูปธรรม: คลิปง่ายสิบคลิปไม่สามารถเป็นตัวแทนของไฟล์บันทึกการประชุมเชิงปฏิบัติการที่เป็นปัจจัยขับเคลื่อนการจัดซื้อได้ ในกระบวนการทำงาน ‘การโทรหาลูกค้าหลายภาษา’ ให้มุ่งเน้นการสลับภาษาและชื่อ และเก็บผลลัพธ์แยกตามภาษาเป็นกฎการตรวจทาน สำหรับการทบทวนระเบียบวิธีการทดสอบมาตรฐานที่ทำซ้ำได้นี้ ให้เก็บรักษาบริบทของแหล่งข้อมูลไว้เพียงพอที่จะแยกแยะข้อผิดพลาดในการรู้จำ ข้อผิดพลาดด้านภาษา ข้อผิดพลาดของผู้พูด การอนุมานจากบทสรุป การคลาดเคลื่อนของการแปล หรือการเขียนใหม่โดยบรรณาธิการ

การดำเนินการถัดไปคือสร้างเมทริกซ์เงื่อนไขและกรอกข้อมูลในทุกช่องที่จำเป็น สำหรับระเบียบวิธีการทดสอบมาตรฐานที่ทำซ้ำได้นี้ ให้บันทึกเฉพาะหลักฐานที่ได้รับอนุญาต ระบุเงื่อนไข และมอบหมายบุคคลที่สามารถอนุมัติ แก้ไข หรือปฏิเสธผลลัพธ์ได้ แบบฟอร์มการทดสอบเก็บรหัสตัวอย่าง เงื่อนไขเสียง เวอร์ชันความจริง การตั้งค่าเครื่องมือ แฮชผลลัพธ์ดิบ คะแนนทุกค่า เวลาแก้ไข การยกเว้น และเหตุผลในการทดสอบซ้ำ

หมายเหตุหลักฐานของระเบียบวิธีการทดสอบมาตรฐานที่ทำซ้ำได้: ตรวจทาน NIST — กรอบการจัดการความเสี่ยงด้าน AI ก่อนอาศัยมาตรฐาน คุณลักษณะ หรือวิธีการที่เกี่ยวข้อง

ความจริงจากมนุษย์ต้องมีการควบคุมคุณภาพของตนเอง

บันทึกถอดเสียงอ้างอิงจะถือเป็นหลักฐานได้ก็ต่อเมื่อมีการบันทึกหลักเกณฑ์และข้อไม่ตรงกันไว้อย่างชัดเจน

ถามว่าหลักฐานใดจะทำให้การตัดสินใจเปลี่ยนแปลง สำหรับ ‘การทำให้เป็นมาตรฐาน’ สิ่งที่ต้องค้นพบคือ ตัวพิมพ์เล็กใหญ่ เครื่องหมายวรรคตอน ตัวเลข และคำเติมต้องเป็นไปตามกฎที่เขียนไว้ อินเทอร์เฟซที่ลื่นไหล คะแนนที่ดูสูง หรือรายการภาษาที่ยาวไม่สามารถแก้ไขความล้มเหลวที่ว่า ‘การให้คะแนนเอื้อรูปแบบผลลัพธ์แบบใดแบบหนึ่ง’ ได้

ใช้ตัวอย่างนี้เป็นการทดสอบขนาดย่อม: ผู้ตรวจสอบสองคนไม่เห็นด้วยเกี่ยวกับรหัสผลิตภัณฑ์ที่ซ้อนทับกันและส่งเรื่องไปให้ผู้ชี้ขาด อ่านควบคู่กับ ‘การ дикเตชันโดยคนคนเดียว’: ประเด็นเชิงปฏิบัติคือความถูกต้องของคำและเอนทิตี ขณะที่เกณฑ์พื้นฐานแบบง่ายมีหน้าที่เพียงให้บุคคลอยู่ภายในห่วงโซ่อำนาจ Unknown reproducible benchmark protocol behavior remains N/A until observed.

ก่อนเผยแพร่หรือจัดซื้อ ให้กำหนดเวอร์ชันของข้อมูลอ้างอิงและเก็บบันทึกการชี้ขาดไว้ สำหรับการทดสอบโปรโตคอลการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้นี้ ให้บันทึกอินพุต การตั้งค่า แหล่งที่มา ผลลัพธ์ การแก้ไข และผู้ตรวจสอบ ณ ขั้นตอนที่ข้อมูลเหล่านั้นมีความสำคัญ หากกระบวนการอัตโนมัติไม่สามารถรักษาหลักฐานไว้ได้ ให้จำกัดการตัดสินใจไว้ที่เงื่อนไขที่ทดสอบแล้ว ทดสอบกรณีที่มีข้อโต้แย้งซ้ำโดยไม่เปิดเผยผลเดิม และใช้โครงการนำร่องที่มีบันทึกการแก้ไขโดยมนุษย์ก่อนจัดซื้อ

บันทึกหลักฐานของโปรโตคอลการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้: ตรวจสอบ คณะกรรมาธิการการค้าแห่งสหพันธรัฐสหรัฐอเมริกา — ตรวจสอบคำกล่าวอ้างเกี่ยวกับ AI ของคุณ ก่อนพึ่งพามาตรฐาน ฟีเจอร์ หรือวิธีการที่เกี่ยวข้อง

ดำเนินการต่อด้วย วิธีการถอดเสียงการประเมินเทคโนโลยี AI หรือ เวิร์กโฟลว์การแปลด้วย AI

ลงทะเบียนหลักเกณฑ์การให้คะแนนล่วงหน้าก่อนเห็นผู้ชนะ

ตัวเลือกในการทำให้เป็นมาตรฐานสามารถเปลี่ยนอันดับได้ และต้องไม่ปรับแต่งหลังจากผลลัพธ์ปรากฏแล้ว

ส่วนนี้ทำหน้าที่เป็นด่านตรวจ ไม่ใช่รายการฟีเจอร์ ด่านตรวจคือ ‘ต้นทุนการแก้ไข’: จะผ่านได้ก็ต่อเมื่อมีการวัดเวลาที่มนุษย์ใช้แก้ไขโดยไม่เปิดเผยผลเดิม และจะไม่ผ่านอย่างมีนัยสำคัญเมื่อการจัดอันดับไม่คำนึงถึงภาระงานเชิงปฏิบัติ กรอบคิดนี้ทำให้วิธีการทดสอบเกณฑ์มาตรฐานการถอดเสียงด้วย AI เชื่อมโยงกับการตัดสินใจจริง

พิจารณากรณีเชิงปฏิบัติการ: ผลลัพธ์หนึ่งเขียนว่า 'twenty one' ขณะที่อีกผลลัพธ์เขียนว่า '21' ภายใต้นโยบายที่ไม่ได้ระบุ รูปแบบที่เทียบเคียงได้คือ ‘การโทรหาลูกค้าหลายภาษา’ ซึ่งให้ความสำคัญกับการสลับภาษาและชื่อมากกว่าความคล่องแคล่วโดยรวม และใช้ผลลัพธ์ที่แยกตามภาษาเพื่อการส่งต่อ การทดสอบที่มีขอบเขตสามารถทำซ้ำได้ แต่คำสัญญาที่ครอบคลุมกว้างไม่สามารถทำได้

ปิดด่านตรวจด้วยการตัดสินใจตรึงสคริปต์ การตั้งค่า การทดสอบซ้ำ ข้อยกเว้น และกฎกรณีคะแนนเสมอกัน แผ่นบันทึกการทดสอบจะเก็บรหัสตัวอย่าง เงื่อนไขเสียง เวอร์ชันความจริง การตั้งค่าเครื่องมือ แฮชผลลัพธ์ดิบ คะแนนทุกค่า เวลาแก้ไข ข้อยกเว้น และเหตุผลที่ทดสอบซ้ำ เผยแพร่ข้อยกเว้นที่เหลือ และส่งเนื้อหาที่มีข้อโต้แย้งหรือมีผลกระทบสำคัญผ่านทางเลือกสำรองนี้: จำกัดการตัดสินใจไว้ที่เงื่อนไขที่ทดสอบแล้ว ทดสอบกรณีที่มีข้อโต้แย้งซ้ำโดยไม่เปิดเผยผลเดิม และใช้โครงการนำร่องที่มีบันทึกการแก้ไขโดยมนุษย์ก่อนจัดซื้อ

รายการยอมรับหลักฐานที่ผ่านเกณฑ์ความล้มเหลวที่มีนัยสำคัญ
ความเท่าเทียมของคลังข้อมูลผู้สมัครทุกคนได้รับไฟล์ต้นฉบับเดียวกันตัวอย่างที่สะอาดและตัวอย่างที่ยากถูกจัดสรรอย่างไม่เท่าเทียม
ความจริงพื้นฐานข้อไม่ตรงกันของมนุษย์ได้รับการแก้ไขและกำหนดเวอร์ชันบันทึกถอดเสียงที่ไม่ได้ตรวจสอบหนึ่งรายการกลายเป็นเฉลย
การทำให้เป็นมาตรฐานตัวพิมพ์เล็กใหญ่ เครื่องหมายวรรคตอน ตัวเลข และคำเติมเป็นไปตามกฎที่เขียนไว้การให้คะแนนเอื้อรูปแบบผลลัพธ์แบบใดแบบหนึ่ง
เอนทิตีสำคัญชื่อ ตัวเลข คำศัพท์ และการปฏิเสธได้รับคะแนนแยกต่างหากWER รวมซ่อนความล้มเหลวที่มีต้นทุนสูง
การจัดการผู้พูดการระบุผู้พูดและการพูดทับซ้อนได้รับการให้คะแนนในกรณีที่เกี่ยวข้องคำถูกต้องแต่ระบุผู้พูดผิดกลับผ่านเกณฑ์
ต้นทุนการแก้ไขวัดเวลาที่มนุษย์ใช้แก้ไขโดยไม่เปิดเผยผลเดิมการจัดอันดับไม่คำนึงถึงภาระงานเชิงปฏิบัติการ
ภาพประกอบเทคโนโลยีห้องปฏิบัติการของเครื่องมือความแม่นยำที่สร้างขึ้นเฉพาะสำหรับวิธีการทดสอบเกณฑ์มาตรฐานการถอดเสียงด้วย AI แสดงวิธีการทดสอบ
ภาพประกอบเทคโนโลยีห้องปฏิบัติการของเครื่องมือความแม่นยำที่เรนเดอร์ขึ้นในเครื่อง แสดงวิธีการทดสอบสำหรับโปรโตคอลการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้นี้ ไม่ใช่อินเทอร์เฟซหรือการทดสอบผลิตภัณฑ์ของ HiNoter

บันทึกหลักฐานของโปรโตคอลการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้: ตรวจสอบ เอกสาร Cloud Speech-to-Text ของ Google Cloud ก่อนพึ่งพามาตรฐาน ฟีเจอร์ หรือวิธีการที่เกี่ยวข้อง

WER เป็นเกณฑ์พื้นฐาน ไม่ใช่คำตัดสินทางธุรกิจ

ระยะห่างของการแก้ไขโดยรวมปฏิบัติต่อข้อผิดพลาดที่ไม่เป็นอันตรายและข้อผิดพลาดที่มีผลกระทบสำคัญเสมือนกัน

เริ่มจากหลักฐาน: ใช้ ‘การทำให้เป็นมาตรฐาน’ เป็นรายการยอมรับ การผ่านหมายความว่าตัวพิมพ์เล็กใหญ่ เครื่องหมายวรรคตอน ตัวเลข และคำเติมเป็นไปตามกฎที่เขียนไว้ ขอบเขตของความล้มเหลวคือการให้คะแนนเอื้อรูปแบบผลลัพธ์แบบใดแบบหนึ่ง ตรึงคลังข้อมูลและกฎการให้คะแนนก่อนประมวลผลผู้สมัครรายแรก

นำกฎนี้ไปใช้กับเหตุการณ์: เครื่องมือหนึ่งชนะด้วย WER แต่เปลี่ยนเจ้าของบัญชีในการโทรที่สำคัญสองครั้ง สิ่งนี้คล้ายกับกรณี ‘การ дикเตชันโดยคนคนเดียว’ ซึ่งเป้าหมายของหลักฐานคือความถูกต้องของคำและเอนทิตี และขอบเขตของมนุษย์คือเกณฑ์พื้นฐานแบบง่ายเท่านั้น สำหรับโปรโตคอลการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้นี้ ประเด็นไม่ใช่การทำให้ผลลัพธ์ดูมีความสามารถน้อยลง แต่คือการระบุเงื่อนไขที่แน่นอนซึ่งเพื่อนร่วมงานสามารถทำซ้ำคำกล่าวอ้างนั้นได้

การตัดสินใจ: เพิ่มคะแนนสำหรับเอนทิตี การปฏิเสธ การระบุผู้พูด การละเว้น และข้อผิดพลาดที่มีนัยสำคัญ แผ่นบันทึกการทดสอบจะเก็บรหัสตัวอย่าง เงื่อนไขเสียง เวอร์ชันความจริง การตั้งค่าเครื่องมือ แฮชผลลัพธ์ดิบ คะแนนทุกค่า เวลาแก้ไข ข้อยกเว้น และเหตุผลที่ทดสอบซ้ำ หากห่วงโซ่แหล่งที่มาสิ้นสุดลง ข้อสรุปต้องแคบลง หากเส้นทางล้มเหลว ให้จำกัดการตัดสินใจไว้ที่เงื่อนไขที่ทดสอบแล้ว ทดสอบกรณีที่มีข้อโต้แย้งซ้ำโดยไม่เปิดเผยผลเดิม และใช้โครงการนำร่องที่มีบันทึกการแก้ไขโดยมนุษย์ก่อนจัดซื้อ

ภาพประกอบเทคโนโลยีห้องปฏิบัติการเครื่องมือความแม่นยำต้นฉบับของวิธีการทดสอบเกณฑ์มาตรฐานการถอดเสียง AI ที่แสดงขอบเขตความล้มเหลว
ภาพประกอบเทคโนโลยีห้องปฏิบัติการเครื่องมือความแม่นยำต้นฉบับที่เรนเดอร์ภายในเครื่อง แสดงขอบเขตความล้มเหลวสำหรับระเบียบวิธีการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้; ไม่ใช่อินเทอร์เฟซหรือการทดสอบผลิตภัณฑ์ของ HiNoter

หมายเหตุหลักฐานของระเบียบวิธีการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้: โปรดตรวจสอบ Microsoft Learn — เอกสาร Speech to text ก่อนพึ่งพามาตรฐาน ฟีเจอร์ หรือวิธีการที่เกี่ยวข้อง

เวลาที่ใช้แก้ไขเปลี่ยนความแม่นยำให้เป็นต้นทุนการดำเนินงาน

ข้อความถอดเสียงดิบที่ดีที่สุดอาจยังใช้เวลาแก้ไขนานกว่า หากค้นหาข้อผิดพลาดได้ยาก

ให้ถือว่า ‘เวลาที่ใช้แก้ไขเปลี่ยนความแม่นยำให้เป็นต้นทุนการดำเนินงาน’ เป็นทางเลือกด้านการดำเนินงาน ข้ออ้างนี้มีประโยชน์ก็ต่อเมื่อวัดเวลาที่มนุษย์ใช้แก้ไขโดยไม่ทราบผลลัพธ์ หากการจัดอันดับไม่คำนึงถึงภาระงานในการดำเนินงาน ให้หยุดเปลี่ยนสิ่งที่ไม่ทราบหรือข้อขัดแย้งให้กลายเป็นคะแนนที่เอื้อประโยชน์

ตัวอย่างโต้แย้งเป็นรูปธรรม: ผู้ตรวจวัดเวลาในการแก้ไขงานเดียวกันโดยไม่ทราบผลลัพธ์ และบันทึกความพยายามในการค้นหา การเล่นซ้ำ และการติดป้ายกำกับใหม่ ในเวิร์กโฟลว์ ‘การสนทนากับลูกค้าหลายภาษา’ ให้มุ่งเน้นการสลับภาษาและชื่อ และคงผลลัพธ์แยกตามภาษาไว้เป็นกฎการตรวจสอบ สำหรับการตรวจสอบระเบียบวิธีการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้นี้ ให้เก็บบริบทต้นฉบับไว้เพียงพอที่จะแยกแยะข้อผิดพลาดด้านการรู้จำ ข้อผิดพลาดด้านภาษา ข้อผิดพลาดด้านผู้พูด การอนุมานจากบทสรุป การคลาดเคลื่อนของการแปล หรือการเขียนเรียบเรียงโดยบรรณาธิการ

ขั้นตอนถัดไปคือการวัดเวลาซ่อมแซมค่ามัธยฐานและใส่คำอธิบายประเภทความล้มเหลว สำหรับระเบียบวิธีการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้นี้ ให้บันทึกเฉพาะหลักฐานที่ได้รับอนุญาต ระบุเงื่อนไข และมอบหมายให้บุคคลที่สามารถอนุมัติ แก้ไข หรือปฏิเสธผลลัพธ์เป็นผู้รับผิดชอบ แผ่นบันทึกการทดสอบจะเก็บรหัสตัวอย่าง เงื่อนไขเสียง เวอร์ชันความจริง การตั้งค่าเครื่องมือ แฮชผลลัพธ์ดิบ คะแนนทุกค่า เวลาแก้ไข รายการที่ยกเว้น และเหตุผลในการรันทดสอบใหม่

หมายเหตุหลักฐานของระเบียบวิธีการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้: โปรดตรวจสอบ คู่มือนักพัฒนา Amazon Web Services — Amazon Transcribe ก่อนพึ่งพามาตรฐาน ฟีเจอร์ หรือวิธีการที่เกี่ยวข้อง

นำ HiNoter ขึ้นทดสอบบนแท่นเดียวกัน: ใช้ตัวอย่างหนึ่งรายการที่ได้รับอนุญาตและไม่มีข้อมูลละเอียดอ่อน และ ประเมินเวิร์กโฟลว์ HiNoter ปัจจุบัน เฉพาะภายในขอบเขตพฤติกรรมที่ได้รับการตรวจสอบแล้ว

นำ HiNoter ขึ้นทดสอบบนแท่นเดียวกัน

HiNoter ควรได้รับคลังข้อมูล การกำหนดค่าที่อนุญาต ช่วงเวลา และโค้ดให้คะแนนชุดเดียวกัน

ถามว่าหลักฐานใดจะเปลี่ยนแปลงการตัดสินใจ สำหรับ ‘การปรับรูปแบบให้เป็นมาตรฐาน’ ผลการตรวจสอบที่ต้องการคือ ตัวพิมพ์เล็กใหญ่ เครื่องหมายวรรคตอน ตัวเลข และคำเติมเต็มต้องเป็นไปตามกฎที่เขียนไว้ อินเทอร์เฟซที่ลื่นไหล คะแนนที่ดูสูง หรือรายการภาษาที่ยาวไม่สามารถแก้ไขความล้มเหลวที่ว่า ‘การให้คะแนนเอื้อประโยชน์ต่อรูปแบบผลลัพธ์หนึ่งรูปแบบ’ ได้

ใช้ตัวอย่างนี้เป็นการทดสอบขนาดย่อม: ผลลัพธ์ดิบ พฤติกรรมด้านภาษาที่สังเกตได้ ความสามารถในการตรวจสอบย้อนกลับของบทสรุป และความพยายามในการแก้ไขจะถูกบันทึกโดยไม่อ้างความแม่นยำแบบครอบจักรวาล อ่านควบคู่กับ ‘การพูดคนเดียว’: ประเด็นในทางปฏิบัติคือความแม่นยำของคำและเอนทิตี ขณะที่เกณฑ์พื้นฐานอย่างง่ายเพียงช่วยให้บุคคลยังอยู่ในห่วงโซ่อำนาจหน้าที่ พฤติกรรมของระเบียบวิธีการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้ซึ่งยังไม่ทราบจะยังคงเป็น N/A จนกว่าจะมีการสังเกต

ก่อนเผยแพร่หรือจัดซื้อ ให้เผยแพร่ N/A สำหรับฟีเจอร์หรือภาษาที่ยังไม่ได้ทดสอบจริง สำหรับการทดสอบระเบียบวิธีการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้นี้ ให้บันทึกข้อมูลนำเข้า การตั้งค่า แหล่งที่มา ผลลัพธ์ การแก้ไข และผู้ตรวจในขั้นตอนที่สิ่งเหล่านั้นมีความสำคัญ หากเส้นทางอัตโนมัติไม่สามารถเก็บรักษาหลักฐานได้ ให้จำกัดการตัดสินใจไว้ที่เงื่อนไขที่ทดสอบแล้ว รันทดสอบกรณีที่มีข้อโต้แย้งใหม่โดยไม่ทราบผลลัพธ์ และใช้โครงการนำร่องพร้อมบันทึกการแก้ไขโดยมนุษย์ก่อนจัดซื้อ

หมายเหตุหลักฐานของระเบียบวิธีการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้: โปรดตรวจสอบ HiNoter — เว็บไซต์ผลิตภัณฑ์ HiNoter ก่อนพึ่งพามาตรฐาน ฟีเจอร์ หรือวิธีการที่เกี่ยวข้อง

รายงานที่ทำซ้ำได้แสดงให้เห็นว่าการจัดอันดับสิ้นสุดลงที่ใด

ผู้อ่านจำเป็นต้องทราบเงื่อนไข จำนวนตัวอย่าง วันที่ รายการที่ยกเว้น และความไม่แน่นอนก่อนนำผลลัพธ์ไปใช้ที่อื่น

ส่วนนี้ทำหน้าที่เป็นด่านคัดกรองแทนที่จะเป็นรายการฟีเจอร์ ด่านนี้คือ ‘ต้นทุนการซ่อมแซม’: ผ่านก็ต่อเมื่อวัดเวลาที่มนุษย์ใช้แก้ไขโดยไม่ทราบผลลัพธ์ และถือว่าล้มเหลวอย่างมีนัยสำคัญเมื่อการจัดอันดับไม่คำนึงถึงภาระงานในการดำเนินงาน กรอบคิดนี้ทำให้วิธีการทดสอบเกณฑ์มาตรฐานการถอดเสียง AI เชื่อมโยงกับการตัดสินใจจริง

พิจารณากรณีด้านการดำเนินงาน: ตารางสรุปคะแนนขั้นสุดท้ายระบุว่าข้อสรุปไม่ครอบคลุมภาษาใหม่ เสียงโทรศัพท์ หรือเวอร์ชันโมเดลในอนาคต รูปแบบที่เปรียบเทียบได้คือ ‘การสนทนากับลูกค้าหลายภาษา’ ซึ่งให้ความสำคัญกับการสลับภาษาและชื่อมากกว่าความคล่องแคล่วทั่วไป และใช้ผลลัพธ์แยกตามภาษาเพื่อการยกระดับ การทดสอบที่มีขอบเขตสามารถทำซ้ำได้; คำสัญญาที่กว้างไม่สามารถทำเช่นนั้นได้

ปิดด่านด้วยการตัดสินใจจัดเก็บข้อมูลนำเข้า แฮช ผลลัพธ์ สคริปต์ และเวอร์ชันรายงานในคลัง แผ่นบันทึกการทดสอบจะเก็บรหัสตัวอย่าง เงื่อนไขเสียง เวอร์ชันความจริง การตั้งค่าเครื่องมือ แฮชผลลัพธ์ดิบ คะแนนทุกค่า เวลาแก้ไข รายการที่ยกเว้น และเหตุผลในการรันทดสอบใหม่ เผยแพร่รายการที่ยังคงยกเว้น และส่งเนื้อหาที่มีข้อโต้แย้งหรือมีผลกระทบสำคัญผ่านทางเลือกสำรองนี้: จำกัดการตัดสินใจไว้ที่เงื่อนไขที่ทดสอบแล้ว รันทดสอบกรณีที่มีข้อโต้แย้งใหม่โดยไม่ทราบผลลัพธ์ และใช้โครงการนำร่องพร้อมบันทึกการแก้ไขโดยมนุษย์ก่อนจัดซื้อ

การประชุมหรือกรณีทดสอบเป้าหมายของหลักฐานขอบเขตของมนุษย์
การพูดคนเดียวความแม่นยำของคำและเอนทิตีเกณฑ์พื้นฐานอย่างง่ายเท่านั้น
การประชุมทีมแบบผสมช่องสัญญาณ ผู้พูด และเสียงพูดทับซ้อนแยกการระบุแหล่งที่มาของคะแนน
การสนทนากับลูกค้าหลายภาษาการสลับภาษาและชื่อแยกผลลัพธ์ตามภาษา
การตรวจสอบที่มีผลกระทบสำคัญการตัดสินใจและข้อความอ้างอิงใช้ด่านคัดกรองข้อผิดพลาดที่มีสาระสำคัญ
ภาพประกอบเทคโนโลยีห้องปฏิบัติการเครื่องมือความแม่นยำต้นฉบับของวิธีการทดสอบเกณฑ์มาตรฐานการถอดเสียง AI ที่แสดงการตัดสินใจด้านการตรวจสอบและการกู้คืน
ภาพประกอบเทคโนโลยีห้องปฏิบัติการเครื่องมือความแม่นยำต้นฉบับที่เรนเดอร์ภายในเครื่อง แสดงการตัดสินใจด้านการตรวจสอบและการกู้คืนสำหรับระเบียบวิธีการทดสอบเกณฑ์มาตรฐานที่ทำซ้ำได้นี้; ไม่ใช่อินเทอร์เฟซหรือการทดสอบผลิตภัณฑ์ของ HiNoter

บันทึกหลักฐานเกี่ยวกับแนวทางการทดสอบมาตรฐานที่ทำซ้ำได้: โปรดทบทวน NIST — ชุดเครื่องมือให้คะแนนการรู้จำเสียงพูด ก่อนอาศัยมาตรฐาน ฟีเจอร์ หรือวิธีการที่เกี่ยวข้อง

คำถามเกี่ยวกับแนวทางการทดสอบมาตรฐานที่ทำซ้ำได้

วิธีที่เป็นธรรมในการทดสอบมาตรฐานเครื่องมือถอดเสียงคืออะไร

การทดสอบมาตรฐานการถอดเสียงที่เป็นธรรมต้องให้เครื่องมือทุกตัวใช้เสียงที่ได้รับอนุญาตเดียวกัน มีโอกาสกำหนดค่าเหมือนกัน กำหนดเวลาส่งออกเหมือนกัน และใช้กฎการให้คะแนนเดียวกัน เก็บรักษาบทถอดเสียงความจริงที่ตรวจสอบโดยมนุษย์ รายงานอัตราความผิดพลาดของคำควบคู่กับชื่อ ตัวเลข ศัพท์เฉพาะ การระบุผู้พูด การตกหล่น และเวลาที่ใช้แก้ไข และเผยแพร่ภาษา สำเนียง อุปกรณ์ เสียงรบกวน จำนวนผู้เข้าร่วม ระยะเวลา และนโยบายการทำให้เป็นมาตรฐาน อย่านำคำกล่าวอ้างด้านความแม่นยำของผู้ขายที่เปรียบเทียบกันไม่ได้มารวมกัน หรือจัดอันดับเครื่องมือที่ทดสอบกับไฟล์ต่างกัน การทดสอบมาตรฐานควรตอบว่าเครื่องมือใดทำงานได้สำหรับเงื่อนไขการประชุมของคุณ ไม่ใช่เครื่องมือใดชนะในทุกกรณี ใช้ข้อสรุปนี้เฉพาะกับภาษา รูปแบบภาษา เงื่อนไขเสียง ผู้พูด การกำหนดค่า ขั้นตอนการส่งออก และกฎการตรวจทานที่มีการทดสอบจริงเท่านั้น

ฉันควรตรวจสอบอะไรก่อนสำหรับวิธีการทดสอบมาตรฐานการถอดเสียงด้วย AI

เริ่มต้นด้วยขอบเขตนี้: ตรึงชุดข้อมูลทดสอบที่เป็นตัวแทนไว้หนึ่งชุด และลงทะเบียนกฎการให้คะแนน การทำให้เป็นมาตรฐาน การยกเว้น การกำหนดค่า การทดสอบซ้ำ และการตัดสินกรณีเสมอล่วงหน้า ก่อนประมวลผลผู้สมัครรายใดก็ตาม เก็บรักษาแหล่งที่มา และกำหนดคำหรือข้อกล่าวอ้างที่มีนัยสำคัญก่อนดูผลลัพธ์ที่ขัดเกลาแล้ว

บทถอดเสียง สรุป หรือคำแปลที่ลื่นไหลมีความถูกต้องหรือไม่

ไม่จำเป็นเสมอไป ความลื่นไหลวัดความสามารถในการอ่าน ขณะที่ความเที่ยงตรงพิจารณาว่าชื่อ ตัวเลข การปฏิเสธ ผู้พูด เงื่อนไข การตัดสินใจ ศัพท์เฉพาะ และน้ำเสียงตรงกับแหล่งที่มาหรือไม่ ตรวจสอบรายการเหล่านี้โดยตรง

ควรทดสอบตัวอย่างหลายภาษาอย่างไร

ใช้เจ้าของภาษา บทถอดเสียงความจริงที่ระบุแท็กท้องถิ่น อุปกรณ์และห้องที่เป็นตัวแทน และแยกผลลัพธ์สำหรับแต่ละภาษาหรือรูปแบบภาษาในภูมิภาค ทำเครื่องหมายทุกจุดที่มีการเปลี่ยนภาษา และอย่ารวม pt-BR กับ pt-PT เป็นคะแนนเดียวโดยไม่มีคำอธิบาย

เมื่อใดจึงจำเป็นต้องมีการตรวจทานโดยมนุษย์

กำหนดให้มีการตรวจทานโดยผู้มีคุณสมบัติสำหรับการตัดสินใจที่มีนัยสำคัญ คำพูดอ้างอิง ข้อผูกพัน บันทึกทางกฎหมายหรือบุคลากร ชื่อและศัพท์เฉพาะที่ไม่คุ้นเคย ข้อความที่มีข้อโต้แย้ง เสียงคุณภาพต่ำ และผลลัพธ์ใด ๆ ที่ไม่สามารถตรวจสอบย้อนกลับไปยังแหล่งที่มาได้

ควรประเมิน HiNoter อย่างไร

ดำเนินการกรณีนี้ในเวอร์ชันที่ได้รับอนุญาตและไม่มีข้อมูลอ่อนไหว: ทีมจัดซื้อเปรียบเทียบเดโมภาษาอังกฤษที่ชัดเจนของผู้ขายรายหนึ่งกับสายสนทนาหลายภาษาที่มีเสียงรบกวนของผู้ขายอีกราย แล้วเผยแพร่ตารางจัดอันดับที่ทำให้เข้าใจผิด ตรวจสอบอินพุตปัจจุบัน ภาษา บทถอดเสียง สรุปหรือคำแปล การนำทางแหล่งที่มา การแก้ไข การส่งออก การเข้าถึง และพฤติกรรมการลบข้อมูล และระบุ N/A สำหรับสิ่งที่ยังไม่ได้ทดสอบ

ขอบเขตการตัดสินใจ

สำหรับ ‘วิธีที่เป็นธรรมในการทดสอบมาตรฐานเครื่องมือถอดเสียงคืออะไร’ คำตอบที่ปกป้องได้ยังคงขึ้นอยู่กับเงื่อนไข การทดสอบมาตรฐานการถอดเสียงที่เป็นธรรมต้องให้เครื่องมือทุกตัวใช้เสียงที่ได้รับอนุญาตเดียวกัน มีโอกาสกำหนดค่าเหมือนกัน กำหนดเวลาส่งออกเหมือนกัน และใช้กฎการให้คะแนนเดียวกัน เก็บรักษาบทถอดเสียงความจริงที่ตรวจสอบโดยมนุษย์ รายงานอัตราความผิดพลาดของคำควบคู่กับชื่อ ตัวเลข ศัพท์เฉพาะ การระบุผู้พูด การตกหล่น และเวลาที่ใช้แก้ไข และเผยแพร่ภาษา สำเนียง อุปกรณ์ เสียงรบกวน จำนวนผู้เข้าร่วม ระยะเวลา และนโยบายการทำให้เป็นมาตรฐาน อย่านำคำกล่าวอ้างด้านความแม่นยำของผู้ขายที่เปรียบเทียบกันไม่ได้มารวมกัน หรือจัดอันดับเครื่องมือที่ทดสอบกับไฟล์ต่างกัน การทดสอบมาตรฐานควรตอบว่าเครื่องมือใดทำงานได้สำหรับเงื่อนไขการประชุมของคุณ ไม่ใช่เครื่องมือใดชนะในทุกกรณี ผู้ชนะที่ปกป้องได้คือเครื่องมือที่ทำผลงานได้ดีที่สุดภายในขอบเขตการตัดสินใจที่เผยแพร่ ไม่ใช่เครื่องมือที่ผูกติดกับตัวเลขที่ใหญ่ที่สุดโดยไม่มีคำอธิบาย หากหลักฐานไม่สามารถรองรับข้อความเกี่ยวกับวิธีการทดสอบมาตรฐานการถอดเสียงด้วย AI ได้ ให้เผยแพร่ว่าไม่ได้รับการตรวจสอบหรือ N/A แทนการประมาณการในทางที่ดี

ดำเนินการทดสอบมาตรฐานการถอดเสียงที่ทำซ้ำได้: ดำเนินการกับตัวอย่างที่เป็นตัวแทนหนึ่งตัวอย่าง เปรียบเทียบผลลัพธ์กับแหล่งที่มา และ ทดสอบ HiNoter เฉพาะภายในภาษาและขั้นตอนการทำงานที่ตรงตามที่คุณตรวจสอบเท่านั้น