안녕하세요.
소리로 자막 생성을 하는 기능에서 맨처음에 동영상에서 음성을 추출한 다음에 진행이 되는 것 같던데요.
음성 추출하는 기능 자체는 팟플레이어에서 하고나서 ,변환엔진에서 그 음성파일을 열어서 진행을 하는 건가요?
아니면 음성 추출 기능 자체가 변환엔진에 포함이 되어있는건가요?(즉, 팟플레이어는 아무것도 관여하지않고 변환엔진 자체로 음성 추출도하고 그 파일로 텍스트로 변환하는 것)
감사합니다.
다음검색
댓글
댓글 리스트-
작성자팟플.개발자 작성시간 25.06.11 음성 추출은 팟플레이어에서 하고 그것을 위스퍼 엔진에 넘겨서 처리를 하는 방식 입니다.
-
답댓글 작성자라라베이컨 작성자 본인 여부 작성자 작성시간 25.06.11 답변 감사합니다.
이것이 궁금했던 점이, 하드디스크 기준 약 15~25gb 용량의 영상에서 소리로 자막생성 기능 사용시에 음성 추출되는 시간이 너무 오래걸리더라고요. 체감상 5분 이상?
근데 직접 ffmpeg로 음성추출을 하면 좀 더 빠르게 되어서요. (2~3분 내외)
추출된 음성의 용량은 100mb정도 되고요.
제가 사용한 옵션은 ffmpeg -i video_path -vn -acodec copy -map 0:a:0 -y 이정도 입니다.
제 시스템에서만 느린거일 수도 있어서 신경 안쓰셔도 됩니다. -
답댓글 작성자팟플.개발자 작성시간 25.06.12 라라베이컨 라라베이컨님이 사용하는 옵션은 디코딩이 없이 단순히 음성만 추출 해서 더 빠르게 동작 되는것이고..
팟플레이어는 디코딩과 샘플링 레이트 변환과 기타 다른 처리가 들어가기 때문에 해당 사항 보다 더 느리게 동작이 되는것입니다.