Usuń szum z tła
Przeciągnij nagranie i odbierz je z przyciszonym buczeniem, szumem, ruchem ulicznym i gwarem. Czyszczenie odbywa się w przeglądarce: nic nie jest przesyłane, chyba że potem klikniesz Transkrybuj, i nie wymaga to konta.
Jak to działa
Szum jest usuwany przez DeepFilterNet 3, sieć neuronową open-source stworzoną z myślą o mowie. Analizuje ona nagranie po dziesięć milisekund naraz i pasmo po paśmie ścisza to, co uzna za dźwięk inny niż głos.
LICENSE-DeepFilterNet-MIT.txt · LICENSE-DeepFilterNet-APACHE.txt · THIRD-PARTY-NOTICES.txt
Przeglądarka dekoduje plik, model działa na procesorze twojego urządzenia, a wyczyszczony dźwięk jest pobierany z tej strony. Gdy wybierasz nagranie po raz pierwszy, strona pobiera model oraz kod do jego uruchomienia z txscribe.ai — około 20 MB po rozpakowaniu — a twoja przeglądarka zachowuje je na przyszłość.
Wyczyszczony plik pokrywa się z oryginałem co do próbki, więc możesz przełączać się między nimi w połowie słowa i dokładnie usłyszeć, co się zmieniło.
Co obsługuje, a czego nie
- Buczenie, szum, klimatyzacja, deszcz, klawiatury, ruch uliczny
- Przyciszone najbardziej. W naszych testach, w przerwach między słowami, każdy z tych dźwięków spadł do ułamka swojego pierwotnego poziomu. Pod słowami, gdzie hałas był tak głośny jak głos, zniknęła też drobna część głosu.
- Głosy innych osób w tle
- To zależy od głosów. W naszych testach gwar w restauracji spadł tak samo jak ruch uliczny; w klasie, w której wybijają się pojedyncze głosy, spadł o mniej niż połowę tego, co ruch uliczny. Model jest stworzony tak, by zachowywać głosy.
- Inna osoba mówiąca blisko mikrofonu
- Przyciszony, nieusunięty: w naszych testach drugi głos osiągnął około połowy swojego poziomu, a główny głos również trochę stracił. Model nie potrafi określić, o którego mówcę ci chodziło.
- Głos cichszy niż nakładający się na niego hałas
- Najtrudniejszy przypadek: głos może zniknąć razem z hałasem. W naszym teście odległy głos zagłuszony głośniejszym pomieszczeniem osiągnął poziom około jednej dziesiątej pierwotnej głośności. Odsłuchaj te fragmenty przed użyciem wyniku.
- Nagranie, które jest już czyste
- Wraca niemal bez zmian.
Limity i formaty
Do 10 min i 500 MB
- Co otwiera
- Pliki audio MP3, M4A, AAC, WAV, FLAC, OGG, Opus i WebM oraz dźwięk z filmów MP4 i MOV: każdy z nich zdekodował się w każdym silniku przeglądarki, który przetestowaliśmy. Wszystko inne zależy od twojej przeglądarki; jeśli nie potrafi zdekodować pliku, strona o tym informuje.
- Co otrzymujesz
- Plik WAV: 16-bit, 48 kHz, jeden kanał — około 5.5 MB na minutę. Nagranie stereo jest najpierw miksowane do mono. Z wideo otrzymujesz dźwięk, a nie nowy film.
Prywatność
Nagranie pozostaje na twoim urządzeniu: jest dekodowane, oczyszczane i zapisywane tutaj, a żadna jego część nie jest nigdzie wysyłana. Zliczamy, które kroki na stronie są wykorzystywane — wybranie, oczyszczenie, pobranie pliku — bez dołączania nazwy pliku, jego długości ani dźwięku. Tylko Transkrybuj przesyła oryginał i jest to napisane obok przycisku.
Pytania
Czy to jest bezpłatne?
Tak, bez konta, bez znaku wodnego i bez instalowania czegokolwiek. Limity dotyczą samego pliku: do 10 min i 500 MB.
Czy moje nagranie jest przesyłane?
Czyszczone w tej przeglądarce. Nic nie jest przesyłane, chyba że potem klikniesz Transkrybuj.
Dlaczego niektóre słowa brzmią potem płycej?
Gdy głos i hałas w tle mają zbliżoną głośność, model musi na bieżąco decydować, co jest głosem, przez co część głosu zostaje przyciszona razem z hałasem. Słowo cichsze niż nałożony na nie hałas może niemal całkowicie zniknąć. Przed użyciem wyniku przełączaj między Przed i Po we fragmentach, które mają dla ciebie znaczenie.
Czy może wyczyścić dźwięk z wideo?
Tak: wybierz wideo, a otrzymasz z powrotem wyczyszczony dźwięk jako plik WAV — a nie nowy film.
Dlaczego opcja Transkrybuj korzysta z oryginalnego nagrania, a nie z wyczyszczonego?
Wyczyszczona kopia służy do słuchania. Czyszczenie modyfikuje nie tylko hałas, ale też trochę sam głos, i nie twierdzimy, że dzięki temu transkrypcja będzie dokładniejsza — dlatego przycisk Transkrybuj wysyła nagranie w wybranej przez ciebie postaci.
W jakich przeglądarkach to działa?
Nowsze wersje: Chrome lub Edge, Firefox 114 lub nowszy, albo Safari 16.4 lub nowsze. Starsze przeglądarki nie obsługują technologii, na których bazuje narzędzie (WebAssembly z SIMD oraz procesy robocze ładujące moduły), a strona poinformuje cię, jeśli twoja przeglądarka ich nie wspiera. Narzędzie działa na procesorze i w pamięci twojego urządzenia, więc na wolniejszym sprzęcie potrwa to dłużej, a w telefonie może zabraknąć pamięci przy długim nagraniu; strona pokazuje pozostały czas.
Potrzebujesz słów, a nie tylko dźwięku?
txscribe tworzy transkrypcje nagrań w 82 językach ze znacznikiem czasu przy każdym słowie, dzięki czemu każdy wers odtwarza moment, z którego pochodzi. Bezpłatny okres próbny obejmuje jedno nagranie, do minuty 10, bez konieczności zakładania konta.
Rozpocznij bezpłatnie