使用openai-whisper实现语音转文字_Python

使用openai-whisper实现语音转文字

1 安装依赖

1.1 windows下安装ffmpeg

ffmpeg是一套可以用来记录、转换数字音频、视频，并能将其转化为流的开源计算机程序。采用lgpl或gpl许可证。它提供了录制、转换以及流化音视频的完整解决方案。

# ffmpeg官网
https://ffmpeg.org/

# ffmpeg下载地址
https://ffmpeg.org/download.html

# 点击下载后会进入github，地址如下
https://github.com/btbn/ffmpeg-builds/releases

在官网上选择windows版本

在这里插入图片描述

推荐使用ffmpeg-n5.1.4-win64-gpl-5.1.zip 和 ffmpeg-n6.0.1-win64-gpl-6.0.zip这两个版本，因为ffmpeg 5.1.4 和 ffmpeg 6.0.1版本是最新稳定版。

#  auto-build 2023-11-30的地址
https://github.com/btbn/ffmpeg-builds/releases/tag/autobuild-2023-11-30-12-55

# ffmpeg-n5.1.4-win64-gpl-5.1.zip的地址
https://github.com/btbn/ffmpeg-builds/releases/download/autobuild-2023-11-30-12-55/ffmpeg-n5.1.4-win64-gpl-5.1.zip

# ffmpeg-n6.0.1-win64-gpl-6.0.zip的地址
https://github.com/btbn/ffmpeg-builds/releases/download/autobuild-2023-11-30-12-55/ffmpeg-n6.0.1-win64-gpl-6.0.zip

在github上可以选择最新版本，选择ffmpeg-master-latest-win64-gpl.zip；

⚠️ 如果python程序出现“filenotfounderror: [winerror 2] 系统找不到指定的文件。”错误时，可能是ffmpeg版本的问题。

在这里插入图片描述

将ffmpeg-master-latest-win64-gpl.zip 解压到d盘，名字修改为ffmpeg，将目录 d:\ffmpeg\bin 添加到环境变量中。

在这里插入图片描述

在dos页面查看版本号中输入：ffmpeg.exe -version，出现下面的信息表示安装成功。

在这里插入图片描述

1.2 安装openai-whispe

# whispe地址
https://github.com/openai/whisper

# 安装openai-whisper
pip install openai-whisper -i https://pypi.tuna.tsinghua.edu.cn/simple

# 安装pydub切割音频，防止音频太长
pip install pydub -i https://pypi.tuna.tsinghua.edu.cn/simple

下载语音，可以直接在浏览器中打开，再下载

wget -c https://paddlespeech.bj.bcebos.com/paddleaudio/zh.wav
wget -c https://paddlespeech.bj.bcebos.com/paddleaudio/en.wav

2 使用openai-whispe

2.1 工程目录

在这里插入图片描述

2.2 main.py

import whisper
model = whisper.load_model(name="tiny", download_root="./model")

# load audio and pad/trim it to fit 30 seconds
audio = whisper.load_audio(".//data//zh.wav")
audio = whisper.pad_or_trim(audio)

# make log-mel spectrogram and move to the same device as the model
mel = whisper.log_mel_spectrogram(audio).to(model.device)

# detect the spoken language
_, probs = model.detect_language(mel)
print(f"detected language: {max(probs, key=probs.get)}")

# decode the audio
options = whisper.decodingoptions()
result = whisper.decode(model, mel, options)

# print the recognized text
print(result.text)

输出结果：

detected language: zh
我認為跑步最重要的就是給我帶來了身體健康

2.3 简单使用

openai-whispe中的transcribe()方法，可以接收文件路径，也接收numpy的np.ndarray类型（音频流），可以使用librosa包对音频进行处理，librosa包是音频处理的库，主要功能有获取音频流（np.ndarray）、采样率、文件时常、波形图、频谱图等。

# librosa的简单使用，audio_np音频流（np.ndarray），freq音频采样率
audio_np, freq = librosa.load(audio_path)

openai-whispe中的transcribe()方法

import whisper

model = whisper.load_model(name="tiny", download_root="./model")
result = model.transcribe(".//data//zh.wav")
print(result["text"])

opencv实现数码管数字的识别小白篇（python）

原图 -> 灰度处理 -> 二值化处理（数字部分为白色）-> 膨胀处理 -> 寻找轮廓找出所有数字的轮廓，分别传入识别函数（穿针法识别：... [阅读全文]

助力工业物联网，工业大数据之数仓维度层DWS层构建【十二】_工业数据仓库(2)

step3：通过游标来执行SQL语句：execute(String：SQL)化的资料的朋友，可以添加V获取：vip204888 （备注大数据）**如何使用Python构建Oracl…

2024年08月04日 • 前端脚本

OpenCV处理图片拼接

def stich:外部接口函数def detectAndDescribe:用于图片的特征点提取,内部逻辑函数def matchKeypoints:特征点匹配d... [阅读全文]

windows下python opencv ffmpeg读取摄像头实现rtsp推流拉流

新建一个rtsp的文件夹解压进去，会得到两个文件。将bin/ffmpeg.exe 解压到之前的目录。双击运行mediamtx.exe即可开启服务。下载 RTSP... [阅读全文]

OpenCV自带的三种白平衡算法使用演示(代码 + 效果)

许多传统的白平衡算法都是基于统计的，即它们依赖于这样一个事实：某些假设应该在正确白平衡的图像中成立，例如众所周知的灰色世界假设。然而，通过在基于学习的框架中利用具有地面实况光源的大…

2024年08月04日 • 前端脚本

python-sklearn数据分析-线性回归和支持向量机（SVM）回归预测（实战）

注：本文是小编学习实战心得分享，欢迎交流讨论！话不多说，直接附上代码和图示说明。目录一、分段示例1.导入必要的库2.读取数据，查看数据基本信息3.简单查看有无重复值4.对列名进行分…

2024年08月04日 • 前端脚本


验证码：

验证码：

使用openai-whisper实现语音转文字

2024年08月04日 • Python •我要评论