Usuń szum z tła

Przeciągnij nagranie i odbierz je z przyciszonym buczeniem, szumem, ruchem ulicznym i gwarem. Czyszczenie odbywa się w przeglądarce: nic nie jest przesyłane, chyba że potem klikniesz Transkrybuj, i nie wymaga to konta.

Jak to działa

Szum jest usuwany przez DeepFilterNet 3, sieć neuronową open-source stworzoną z myślą o mowie. Analizuje ona nagranie po dziesięć milisekund naraz i pasmo po paśmie ścisza to, co uzna za dźwięk inny niż głos.

LICENSE-DeepFilterNet-MIT.txt · LICENSE-DeepFilterNet-APACHE.txt · THIRD-PARTY-NOTICES.txt

Przeglądarka dekoduje plik, model działa na procesorze twojego urządzenia, a wyczyszczony dźwięk jest pobierany z tej strony. Gdy wybierasz nagranie po raz pierwszy, strona pobiera model oraz kod do jego uruchomienia z txscribe.ai — około 20 MB po rozpakowaniu — a twoja przeglądarka zachowuje je na przyszłość.

Wyczyszczony plik pokrywa się z oryginałem co do próbki, więc możesz przełączać się między nimi w połowie słowa i dokładnie usłyszeć, co się zmieniło.

Co obsługuje, a czego nie

Buczenie, szum, klimatyzacja, deszcz, klawiatury, ruch uliczny
Przyciszone najbardziej. W naszych testach, w przerwach między słowami, każdy z tych dźwięków spadł do ułamka swojego pierwotnego poziomu. Pod słowami, gdzie hałas był tak głośny jak głos, zniknęła też drobna część głosu.
Głosy innych osób w tle
To zależy od głosów. W naszych testach gwar w restauracji spadł tak samo jak ruch uliczny; w klasie, w której wybijają się pojedyncze głosy, spadł o mniej niż połowę tego, co ruch uliczny. Model jest stworzony tak, by zachowywać głosy.
Inna osoba mówiąca blisko mikrofonu
Przyciszony, nieusunięty: w naszych testach drugi głos osiągnął około połowy swojego poziomu, a główny głos również trochę stracił. Model nie potrafi określić, o którego mówcę ci chodziło.
Głos cichszy niż nakładający się na niego hałas
Najtrudniejszy przypadek: głos może zniknąć razem z hałasem. W naszym teście odległy głos zagłuszony głośniejszym pomieszczeniem osiągnął poziom około jednej dziesiątej pierwotnej głośności. Odsłuchaj te fragmenty przed użyciem wyniku.
Nagranie, które jest już czyste
Wraca niemal bez zmian.

Limity i formaty

Do 10 min i 500 MB

Co otwiera
Pliki audio MP3, M4A, AAC, WAV, FLAC, OGG, Opus i WebM oraz dźwięk z filmów MP4 i MOV: każdy z nich zdekodował się w każdym silniku przeglądarki, który przetestowaliśmy. Wszystko inne zależy od twojej przeglądarki; jeśli nie potrafi zdekodować pliku, strona o tym informuje.
Co otrzymujesz
Plik WAV: 16-bit, 48 kHz, jeden kanał — około 5.5 MB na minutę. Nagranie stereo jest najpierw miksowane do mono. Z wideo otrzymujesz dźwięk, a nie nowy film.

Prywatność

Nagranie pozostaje na twoim urządzeniu: jest dekodowane, oczyszczane i zapisywane tutaj, a żadna jego część nie jest nigdzie wysyłana. Zliczamy, które kroki na stronie są wykorzystywane — wybranie, oczyszczenie, pobranie pliku — bez dołączania nazwy pliku, jego długości ani dźwięku. Tylko Transkrybuj przesyła oryginał i jest to napisane obok przycisku.

Pytania

Czy to jest bezpłatne?

Tak, bez konta, bez znaku wodnego i bez instalowania czegokolwiek. Limity dotyczą samego pliku: do 10 min i 500 MB.

Czy moje nagranie jest przesyłane?

Czyszczone w tej przeglądarce. Nic nie jest przesyłane, chyba że potem klikniesz Transkrybuj.

Dlaczego niektóre słowa brzmią potem płycej?

Gdy głos i hałas w tle mają zbliżoną głośność, model musi na bieżąco decydować, co jest głosem, przez co część głosu zostaje przyciszona razem z hałasem. Słowo cichsze niż nałożony na nie hałas może niemal całkowicie zniknąć. Przed użyciem wyniku przełączaj między Przed i Po we fragmentach, które mają dla ciebie znaczenie.

Czy może wyczyścić dźwięk z wideo?

Tak: wybierz wideo, a otrzymasz z powrotem wyczyszczony dźwięk jako plik WAV — a nie nowy film.

Dlaczego opcja Transkrybuj korzysta z oryginalnego nagrania, a nie z wyczyszczonego?

Wyczyszczona kopia służy do słuchania. Czyszczenie modyfikuje nie tylko hałas, ale też trochę sam głos, i nie twierdzimy, że dzięki temu transkrypcja będzie dokładniejsza — dlatego przycisk Transkrybuj wysyła nagranie w wybranej przez ciebie postaci.

W jakich przeglądarkach to działa?

Nowsze wersje: Chrome lub Edge, Firefox 114 lub nowszy, albo Safari 16.4 lub nowsze. Starsze przeglądarki nie obsługują technologii, na których bazuje narzędzie (WebAssembly z SIMD oraz procesy robocze ładujące moduły), a strona poinformuje cię, jeśli twoja przeglądarka ich nie wspiera. Narzędzie działa na procesorze i w pamięci twojego urządzenia, więc na wolniejszym sprzęcie potrwa to dłużej, a w telefonie może zabraknąć pamięci przy długim nagraniu; strona pokazuje pozostały czas.

Potrzebujesz słów, a nie tylko dźwięku?

txscribe tworzy transkrypcje nagrań w 82 językach ze znacznikiem czasu przy każdym słowie, dzięki czemu każdy wers odtwarza moment, z którego pochodzi. Bezpłatny okres próbny obejmuje jedno nagranie, do minuty 10, bez konieczności zakładania konta.

Rozpocznij bezpłatnie