音声のノイズ除去

録音ファイルをドロップすると、ハム音、ヒスノイズ、交通音、周囲のざわめきを抑えた音声を取得できます。ノイズ除去はお使いのブラウザ内で実行されます。後から「文字起こし」を押さない限りアップロードされることはなく、アカウント登録も不要です。

仕組み

ノイズ除去には、音声向けに設計されたオープンソースのニューラルネットワーク「DeepFilterNet 3」を使用しています。録音を10ミリ秒ごとに分析し、声ではないと判定した帯域の音量を順次抑制します。

LICENSE-DeepFilterNet-MIT.txt · LICENSE-DeepFilterNet-APACHE.txt · THIRD-PARTY-NOTICES.txt

ブラウザがファイルをデコードし、デバイスのプロセッサ上でモデルが実行され、ノイズ除去された音声がこのページから保存されます。録音ファイルを初めて選択した際に、モデルと実行コードがtxscribe.aiからダウンロードされます(展開後は約20 MB)。これらは次回以降のためにブラウザに保存されます。

処理後のファイルは元の音声とサンプル単位で一致しているため、単語の途中で切り替えても変化を正確に聴き比べることができます。

対応できるノイズ・対応できないノイズ

ハム音、ヒスノイズ、エアコン、雨音、キーボードの打鍵音、交通音
最も大きく減衰します。テストでは、言葉と言葉の合間の無音区間において、これらのノイズはそれぞれ元のレベルのごく一部まで下がりました。発話の背景でノイズが声と同等に大きかった部分では、声の成分もわずかに削られました。
背後にある他の人の話し声
声の種類によります。当社のテストでは、レストランのざわめきは交通騒音と同程度まで低減しましたが、個々の声が際立つ教室の音は交通騒音の半分未満しか低減しませんでした。このモデルは声を残すように設計されています。
マイクの近くで別の人が話している声
消去されるのではなく、音量が抑えられます。テストでは、2人目の声の音量は約半分に減衰し、主話者の声もわずかに削られました。モデルはどちらの話者を残すべきか判断できません。
重なるノイズよりも小さい声
最も困難なケースであり、声がノイズと一緒に消去されることがあります。テストでは、周囲の騒音よりも小さな遠くの声は、約10分の1の音量まで減衰しました。処理結果をご使用になる前に、該当箇所をお聴きください。
すでにノイズのないクリアな録音
ほぼ元の状態のまま出力されます。

制限事項と対応フォーマット

最大10分・最大500 MB

対応フォーマット
MP3、M4A、AAC、WAV、FLAC、OGG、Opus、WebMの音声、およびMP4とMOV動画の音声:これらはいずれも、テストしたすべてのブラウザエンジンでデコードできました。それ以外の形式はお使いのブラウザに依存します。ファイルをデコードできない場合は、ページ上にその旨が表示されます。
出力されるファイル
WAVファイル形式(16ビット、48 kHz、モノラル)で、1分あたり約5.5 MBです。ステレオ録音は事前にモノラルへミックスされます。動画の場合は新しい動画ではなく、その音声ファイルが出力されます。

プライバシー

録音はお手元のデバイス内に留まります。ここでデコード、ノイズ除去、保存が行われ、どこにも送信されることはありません。弊社では、ファイル名、長さ、音声を紐付けることなく、ページのどのステップが利用されたか(ファイルの選択、ノイズ除去、ダウンロード)をカウントしています。原本がアップロードされるのは「文字起こし」のみであり、ボタンの横にもその旨が明記されています。

よくある質問

無料で使えますか?

はい、アカウント登録不要、ウォーターマークなし、インストール不要でご利用いただけます。制限はファイルに関するもののみで、最大10分、最大500 MBまでとなります。

録音データはアップロードされますか?

このブラウザ内で処理されます。後から「文字起こし」を押さない限り、データがアップロードされることはありません。

処理後に一部の言葉がやせ細って聞こえるのはなぜですか?

声と背後のノイズが同等の音量である場合、モデルはどれが声であるかを瞬間ごとに判断しなければならず、ノイズと一緒に声の一部も音量が抑えられてしまいます。重なるノイズより音量の小さい単語は、ほぼ聞き取れなくなることがあります。処理結果を使用する前に、重要な箇所について「処理前」と「処理後」を切り替えてご確認ください。

動画の音声もノイズ除去できますか?

はい。動画ファイルを選択すると、ノイズ除去された音声がWAVファイルとして出力されます(新しい動画が出力されるわけではありません)。

「文字起こし」でノイズ除去後ではなく元の録音が使われるのはなぜですか?

ノイズ除去後のファイルは聴くためのものです。ノイズ除去によってノイズだけでなく声もわずかに変化するため、トランスクリプトの精度が向上するとは謳っておりません。そのため、「文字起こし」では選択された元の録音データを送信します。

どのブラウザで動作しますか?

最新のブラウザに対応しています(Chrome、Edge、Firefox 114以降、Safari 16.4以降)。古いブラウザでは動作に必要な機能(SIMD対応WebAssembly、モジュール読み込み対応Worker)が備わっていないため、非対応の場合はその旨が表示されます。処理はお使いのデバイスのプロセッサとメモリ上で行われるため、処理速度の遅いデバイスでは時間がかかり、スマートフォンの場合は長時間の録音でメモリ不足になることがあります。ページには残り時間が表示されます。

音声だけでなく、文字も必要ですか?

txscribeは82言語の録音を文字起こしできます。すべての単語にタイムスタンプが付くため、どの行からでも該当する発言位置を再生できます。無料トライアルはアカウント不要で、1件の録音を10分まで文字起こしできます。

無料で始める