文字起こし

Speech-to-Text / Transcription

AI用語

解説

会議や通話の音声をAIがリアルタイムでテキストデータに変換する技術。議事録作成の自動化や記録精度の向上に活用される。

さらに詳しく解説

文字起こし(音声テキスト変換)とは、マイクや録音データから人の声を認識し、自動でテキストデータに変換する技術です。英語では「Speech-to-Text(STT)」とも呼ばれます。

かつては人間が録音を聞きながら手作業で文字を打ち込む必要があり、1時間の会議の文字起こしに2〜3時間かかることも珍しくありませんでした。AI技術の発展により、現在では数分で同じ作業が完了します。

中小企業での活用例としては、社内会議・営業商談・採用面接・研修などの記録が挙げられます。精度は話者の発音や音声品質に左右されるため、良質なマイクを使うと認識精度が向上します。また、専門用語や固有名詞は認識精度が下がる場合があるため、事後確認が必要です。

自社での使い方を相談する

文字起こしを自社の業務に当てはめる場合は、対象業務、既存データ、運用担当者、成果指標を先に整理すると判断しやすくなります。

文字起こし(Speech-to-Text / Transcription)とは | AI用語集 | 株式会社Arstruct