FasterWhisperGUI国内开发者整合的语音转字幕神器
因为国内禁了HuggingFace,所以我最近在部署fast-whisper-web时遇到了麻烦。转而找到了一个国内开发者CheshireCC整合的开源项目:faster-whisper-GUI。
不得不说:虽然很多技术源头来自国外开发,但国内开发者却能把这些技术整合出花样来。faster-whisper-GUI就把Demucs、fast-whisper、whisperX这三个项目整合到了一起。你不得不说作者很有创意:为了减少人声转字幕背景音的干扰,直接把人声提取工具Demucs也整合进来了。语音转文字则使用的是whisper的衍生项目faster-whisper,提取速度更快对显卡的要求更低。最终字幕输出则用到了whisperX。
在使用faster-whisper-GUI前要切换到模型页面,加载faster-whisper模型。作者直接推荐用large模型进行处理,我用RTX2060S测试了一下,速度还是挺快的,所以中端显卡即使用large模型也不用担心速度。
然后切换回主界面,如果你想对音频做一个人声分离再处理,可以用到Demucs,事实上faster-whisper在这一块做的已经足够好,直接进入faster-whisper进行语音转字幕即可。
在转写时模型可自动识别语言类型,但是还是建议提前在fast-whisper的参数页选择好语种。
然后运行转写就可以看到语音识别出台词了(不知道大家看台词能不能猜出我用的案例是哪部电影)。
处理完后会切换到WhisperX进行字幕输出,通过WhisperX可以对输出的文件类型和编码等进行设置,然后就可以导出字幕或者文本文件了。
faster-whisper-GUI其实是一个整合项目,整合了faster-whisper0.9、whisperX3.1.1、Demucs4.0。
虽然我一般更偏向于用原生项目,毕竟原生项目更新更及时,而整合项目毕竟容易有烂尾风险。但是在HuggingFace被禁的大背景下,一些整合项目不仅实用也是大家最省事的解决方案。
关注公众号:拾黑(shiheibook)了解更多
赞助链接:
关注数据与安全,洞悉企业级服务市场:https://www.ijiandao.com/
四季很好,只要有你,文娱排行榜:https://www.yaopaiming.com/
让资讯触达的更精准有趣:https://www.0xu.cn/

随时掌握互联网精彩
- 美元兑人民币汇率2023年10月2日
- 加元兑换人民币汇率2023年8月6日
- Snap内部备忘录:制定60亿美元营收目标,未放弃AR长期愿景
- 习近平在省部级主要领导干部“学习习近平总书记重要讲话精神,迎接党的二十大”专题研讨班上发表重要讲话
- 投资血亏,微博只剩下“吃瓜”? | 热点关注
- 数百亿市场的血管介入手术机器人赛道,睿心医疗如何构筑起壁垒?
- SegmentFault 思否加入 ONES
- 俄乌冲突中的网络对抗分析
- 布里斯班获得2032年夏季奥运会举办权;马斯克称特斯拉可能重新接受比特币支付;河南各地生活必需品市场供求平稳|Do早报
- CAICT:2020年国内市场5G手机累计出货量达到1.63亿部
- 微软予力,永续未来!
- 统信UOS推出终端域管平台 采用Docker化部署方式