배경 소음 제거
녹음 파일을 넣으면 웅웅거리는 소리, 쉭쉭거리는 소리, 교통 소음, 대화 소리를 줄여서 돌려받을 수 있습니다. 정제 작업은 브라우저에서 실행됩니다. 나중에 ‘이 녹음 전사하기’를 누르지 않는 한 아무것도 업로드되지 않으며, 계정도 필요 없습니다.
작동 방식
소음은 음성용으로 제작된 오픈 소스 신경망인 DeepFilterNet 3를 통해 제거됩니다. 녹음을 10밀리초 단위로 분석하여 음성이 아니라고 판단되는 소리를 대역별로 줄입니다.
LICENSE-DeepFilterNet-MIT.txt · LICENSE-DeepFilterNet-APACHE.txt · THIRD-PARTY-NOTICES.txt
브라우저가 파일을 디코딩하고, 모델이 사용자 기기의 프로세서에서 실행되며, 정제된 오디오가 이 페이지에서 저장됩니다. 처음 녹음 파일을 선택하면 페이지에서 모델과 이를 실행하는 코드를 txscribe.ai에서 다운로드하며(압축 해제 시 약 20 MB), 브라우저가 다음 번을 위해 이를 보관합니다.
정제된 파일은 원본과 샘플 단위까지 일치하므로 단어 중간에도 전환하여 무엇이 바뀌었는지 정확히 들어볼 수 있습니다.
처리할 수 있는 것과 없는 것
- 웅웅거림, 쉭쉭거림, 에어컨, 빗소리, 키보드, 교통 소음
- 소리가 가장 많이 줄어듭니다. 테스트 결과, 단어와 단어 사이 멈춤 구간에서는 이러한 소음이 원래 수준의 극히 일부로 줄어들었습니다. 소음이 목소리만큼 컸던 단어 발화 구간에서는 목소리도 소음과 함께 약간 감소했습니다.
- 배경에서 들리는 다른 사람들의 목소리
- 목소리에 따라 다릅니다. 저희 테스트에서는 식당의 웅성거림이 교통 소음만큼 줄어들었지만, 개별 목소리가 두드러지는 교실 소음은 교통 소음의 절반도 줄어들지 않았습니다. 이 모델은 목소리를 보존하도록 설계되었습니다.
- 마이크 근처에서 다른 사람이 말하는 소리
- 제거되는 것이 아니라 소리가 줄어듭니다. 테스트 결과, 두 번째 목소리는 약 절반 수준으로 줄어들었고 주 화자의 목소리도 약간 감소했습니다. 이 모델은 어떤 화자를 원하는지 구분하지 못합니다.
- 소음보다 소리가 작은 음성
- 가장 까다로운 경우: 목소리가 소음과 함께 사라질 수 있습니다. 테스트 결과, 더 큰 주변 소음 아래에 묻힌 먼 거리의 목소리는 약 10분의 1 수준으로 줄어들었습니다. 결과를 사용하기 전에 해당 부분을 먼저 들어보세요.
- 이미 깨끗한 녹음
- 거의 그대로 반환됩니다.
제한 및 형식
최대 10분 및 500 MB
- 지원하는 파일
- MP3, M4A, AAC, WAV, FLAC, OGG, Opus 및 WebM 오디오와 MP4 및 MOV 동영상의 소리: 이 형식들은 모두 저희가 테스트한 모든 브라우저 엔진에서 디코딩되었습니다. 그 밖의 형식은 브라우저에 따라 달라지며, 브라우저가 파일을 디코딩할 수 없는 경우 페이지에 표시됩니다.
- 제공되는 결과물
- WAV 파일: 16비트, 48 kHz, 단일 채널 — 분당 약 5.5 MB입니다. 스테레오 녹음은 먼저 모노로 믹싱됩니다. 동영상의 경우 새 동영상이 아니라 소리만 받게 됩니다.
개인정보 보호
녹음본은 사용자의 기기에 그대로 유지됩니다. 이곳에서 디코딩, 노이즈 제거, 저장이 이루어지며, 그 어떤 내용도 외부로 전송되지 않습니다. 저희는 페이지에서 어떤 단계가 사용되었는지(파일 선택, 노이즈 제거, 다운로드)를 집계하며, 파일 이름, 길이, 소리는 포함되지 않습니다. 오직 '전사하기'만 원본을 업로드하며, 버튼 옆에 해당 내용이 명시되어 있습니다.
질문
무료인가요?
네, 계정이나 워터마크가 없으며 아무것도 설치할 필요가 없습니다. 제한 사항은 파일 자체의 기준뿐입니다. 최대 10분 및 500 MB까지 가능합니다.
제 녹음 파일이 업로드되나요?
현재 브라우저에서 정제됩니다. 나중에 ‘이 녹음 전사하기’를 누르지 않는 한 아무것도 업로드되지 않습니다.
처리 후에 왜 일부 단어가 더 가늘게 들리나요?
목소리와 배경 소음의 크기가 비슷할 때 모델은 매 순간 무엇이 음성인지 판단해야 하며, 이 과정에서 소음과 함께 목소리 일부도 줄어들게 됩니다. 소음보다 소리가 작았던 단어는 거의 사라질 수도 있습니다. 결과를 사용하기 전에 중요한 부분에서 ‘제거 전’과 ‘제거 후’를 전환하며 확인해 보세요.
동영상의 소리도 정제할 수 있나요?
네, 동영상을 선택하면 새 동영상이 아니라 정제된 소리를 WAV 파일로 받게 됩니다.
왜 ‘이 녹음 전사하기’는 정제된 녹음이 아닌 원본 녹음을 사용하나요?
정제된 사본은 청취 목적으로 제작되었습니다. 정제 과정에서 소음뿐만 아니라 목소리도 약간 변경되며, 스크립트의 정확도가 향상된다고 주장하지는 않습니다. 따라서 ‘이 녹음 전사하기’는 사용자가 선택한 원본 녹음을 전송합니다.
어떤 브라우저에서 작동하나요?
최신 브라우저에서 작동합니다. Chrome 또는 Edge, Firefox 114 이상, Safari 16.4 이상이 필요합니다. 구형 브라우저에는 이 도구가 실행되는 환경(SIMD를 지원하는 WebAssembly 및 모듈을 로드하는 worker)이 없으며, 현재 브라우저에서 실행할 수 없는 경우 페이지에 안내가 표시됩니다. 기기의 프로세서와 메모리에서 직접 실행되므로 기기 성능이 낮으면 시간이 더 오래 걸리고, 스마트폰의 경우 녹음 길이가 길면 메모리가 부족할 수 있습니다. 남은 시간은 페이지에 표시됩니다.
소리뿐만 아니라 텍스트도 필요하신가요?
txscribe는 82개 언어로 녹음을 전사하며 단어마다 타임스탬프를 제공하므로, 어떤 줄이든 해당 발언이 나온 순간부터 재생됩니다. 무료 체험은 계정 없이 녹음 파일 1개를 최대 10분까지 전사합니다.
무료로 시작하기