transcribe

音声認識の比較

音声にaws transcribeとwhisperのどちらを選ぶか

aws transcribeとwhisperのどちらを選ぶかは、サンプルの文字起こしだけでは決められません。処理と確認にかかる総コストを比較し、実際の録音で品質を試し、テキストが使える状態になるまでの時間を測りましょう。

品質に差が出る場面

どちらのエンジンも、すべての録音で優れているわけではありません。重要なのは、聞き手や編集者、後続のシステムがどのような誤りを許容できるかです。

インタビュー編集者

2人が互いの発言を遮り合い、引用の正確さに関わる名前や短い返答が登場します。

話者の割り当てと固有名詞を録音と照らし合わせましょう。自然な文章でも、発言者を取り違えていれば誤りです。公開前の人による確認を見込んでおきましょう。

文字起こしと文字起こし文の違い

多言語を扱う研究者

収録データには、さまざまなアクセントや言語、時折の言語の切り替えが含まれます。

全体的な精度の印象だけを頼りにせず、言語グループごとにテストしましょう。文字起こし、翻訳、言語検出を別々の作業として比較しているかも確認してください。

音声をテキストに文字起こし

動画制作者

字幕は専門用語を正確に残しながら、発話とタイミングを合わせる必要があります。

文言とタイムスタンプの使いやすさを両方確認してください。テキストが正確でも、タイミングがずれていると字幕の編集に多くの手間がかかります。

動画をテキストに文字起こし

たまにメモを取る人

短い会議の録音に必要なのは、読みやすいメモであって、自動化されたサービスではありません。

どちらかの処理フローを構築するより、簡単に試してみる方が参考になるかもしれません。決定事項やアクションアイテムを共有する前に、結果を音声と照らし合わせて確認してください。

無料のtranscribe代替サービス

所要時間に差が出る場面

モデルの推論時間やAPIリクエストの所要時間だけでなく、使える文字起こしが完成するまでの経過時間を測定してください。

実際の使用例に近い音声を集める

実際に扱うアクセント、背景ノイズ、語彙、話者の切り替わりが含まれる音声クリップを選んでください。両方のテストで音声と指定する出力形式を同じにしてください。そうしないと、速く見える結果は、入力が簡単だっただけかもしれません。

全工程の時間を測る

AWS Transcribeでは、アップロードまたはストリームの設定、ジョブの完了、結果の取得を含めてください。セルフホストのWhisperでは、ファイル転送、キューでの待機、必要に応じたモデルの起動、推論、タイミングの調整や話者ラベル付けの工程を含めてください。

レビューが終わってから計測を止める

同じレビュアーが同じ合格基準を使い、名前、抜けている語句、話者の切り替わりを修正してください。機械処理の所要時間と編集時間の両方を記録しましょう。最初に届いた結果が、最初に公開できる状態になるとは限りません。

切り替える価値がある場合

この総コストの表を使って、既存のワークロードを移行した場合に何が変わるかを確認してください。予算に金額を計上する前に、AWSの最新料金と実際のコンピューティングコストを確認してください。

AWS Transcribe セルフホストのWhisper
1

主な処理コスト

AWS Transcribe

適用されるAWSのサ​​ービス条件とリージョンに基づいて請求されるサービス利用料。

セルフホストのWhisper

ジョブ間もマシンを稼働させておく場合のアイドル時間を含む、コンピューティングリソースのコスト。

2

セットアップとメンテナンス

AWS Transcribe

API連携、権限、ストレージ設定、サービス監視。

セルフホスト型Whisper

モデルのデプロイ、実行環境の更新、キャパシティ計画、監視。

3

急増する負荷への対応

AWS Transcribe

サービスの制限や、ジョブまたはストリームの制御については、引き続き計画が必要です。

セルフホスト型Whisper

待ち行列や処理時間を許容範囲に保つには、追加の処理能力が必要になる場合があります。

4

話者とタイムスタンプに関する要件

AWS Transcribe

利用可能な出力オプションが、必要な形式に合うか評価してください。

セルフホスト型Whisper

必要な形式にするには、追加の処理やツールが必要になる場合があります。

5

データの取り扱い

AWS Transcribe

ワークフローに合わせて、AWSのリージョン、ストレージ、保存期間、アクセス設定を確認してください。

セルフホスト型Whisper

ホスティング環境を管理できますが、そのセキュリティにも責任を負います。

6

修正にかかるコスト

AWS Transcribe

自社の録音データで編集時間を測定してください。利用料金には確認作業は含まれません。

セルフホスト型Whisper

同様に編集時間を測定してください。コンピューティング環境を自社で保有しても、確認作業はなくなりません。

7

切り替える最大の理由

AWS Transcribe

推論インフラを維持したくないチームには、マネージドサービスの運用が適しています。

セルフホスト型Whisper

既存のコンピューティング環境を十分に活用できているなら、モデルを運用することも現実的です。

評価する録音

文字起こし結果を確認する前の、録音と文書のイラスト
文字起こしのワークフロー比較に関連するイラスト
確認する文字起こし

画像は説明用であり、どちらのエンジンの出力でもありません。品質を比較するには、同じ録音を両方で処理し、それぞれの文字起こしを音声と照合してください。

精度で常に勝る選択肢はない

明瞭な英語音声での結果から、ノイズの多い通話、専門用語、複数言語が混在する音声での性能は予測できません。

対処法実際の録音から小規模な評価セットを作り、文章の読みやすさだけでなく、影響の大きい誤りを確認してください。

コスト削減は保証されない

Whisperはオープンソースのモデルですが、運用にはハードウェアとエンジニアリングの時間が必要です。AWSの利用料金も、サービスの設定や現行の条件によって変わります。

対処法想定する処理量とピーク時の負荷を踏まえ、確認済みの文字起こしを完成させるための月間コストを比較してください。

プライバシー要件への適合は自動的には決まらない

マネージドサービスを使うか、モデルを自社でホストするかだけでは、ワークフローがデータの取り扱いに関する義務を満たしているとは判断できません。

対処法録音と出力データがどこを経由し、誰がアクセスでき、各コピーがどのくらいの期間残るかを確認してください。

人による確認の代わりにはならない

どちらのシステムも、もっともらしく見えても名前、数字、話者を誤って伝える文章を生成することがあります。整った文章ほど、そのような間違いに気づきにくくなります。

対処法重要な箇所は、文字起こしを利用する前に元の音声と照合してください。

処理方法を選ぶ前に録音を試す

今すぐ音声をテキストにする必要があるなら、実際の用途を代表する音声クリップでtranscribeを試し、発話内容と出力を照らし合わせてください。実際のサンプルから、必要な修正、書式設定、所要時間の目安が得られます。ただし、AWS TranscribeとWhisperを条件を揃えて評価する代わりにはなりません。

  • 実際の業務で扱うものに近い音声を使う
  • 名前、数字、話者の切り替わりを確認する
  • 確認にかかる時間も結果に含める

比較に関するよくある質問

すべての録音で確実に優れている方はありません。同じ音声クリップで両方を試し、名前、数字、話者の切り替わり、抜け落ちなど、業務にとって重要な誤りを比較してください。

オープンソースのWhisperモデルは、モデルのライセンス料を払わずに実行できます。ただし、ホスティング、ストレージ、保守、確認には費用がかかります。AWS Transcribeは従量課金制のマネージドサービスです。利用地域と設定に適用される最新の料金条件を確認してください。

AWS Transcribeにはマネージドのストリーミング処理が用意されています。一方、オープンソースのWhisperモデルをほぼリアルタイムで使うには、適切な実装とインフラが必要です。バッチ処理の文字起こし速度からライブでの性能を推測せず、想定される負荷の下で処理全体の遅延を比較してください。

通常、連携部分の修正なしには置き換えられません。切り替える前に、リクエストの処理、出力形式、タイムスタンプ、話者ラベル、スケーリング、監視を確認してください。文字起こし結果のテキストが一致するだけでは不十分です。

セルフホスティングならモデルの実行場所を管理できますが、プライバシーはワークフロー全体に左右されます。データの取り扱いについて説明する前に、アップロード、ログ、バックアップ、アクセス権限、保存期間を確認してください。

transcribe を試す
transcribe を試す