百度语音识别api调用 python

面向未来的历史

10237人浏览 · 2017-02-23 10:34:03

面向未来的历史 · 2017-02-23 10:34:03 发布

最近在处理语音检索相关的事。
其中用到语音识别，调用的是讯飞与百度的api，前者使用js是实现，后者用python3实现（因为自己使用python）

环境：

python3.5
centos 7

流程

整个百度语音识别rest api 使用分为三部分：
1 （申请操作）创建应用，获取应用的 API Key 以及 Secret Key。
2 （程序实现）通过已知的应用的 API Key 以及 Secret Key, 发送post 请求到 https://openapi.baidu.com/oauth/2.0/token 获取 token

3 （程序实现）通过上步骤获取的 token，通过post，发送相关的语音信息到 http://vop.baidu.com/server_api ，获取识别结果.

以上过程参考百度语音开发文档，或者网上的资料：
http://yuyin.baidu.com/docs/asr/57

python实现

程序整体如下：

import requests
import json
import uuid
import base64

def get_token():
    url = "https://openapi.baidu.com/oauth/2.0/token"
    grant_type = "client_credentials"
    api_key = "NzGBYD0jPFDqVT8VHRYa****"                     # 自己申请的应用
    secret_key = "8439155b9db2040b4acd13b0c*****"            # 自己申请的应用
    data = {'grant_type': 'client_credentials', 'client_id': api_key, 'client_secret': secret_key}
    r = requests.post(url, data=data)
    token = json.loads(r.text).get("access_token")
    return token


def recognize(sig, rate, token):
    url = "http://vop.baidu.com/server_api"
    speech_length = len(sig)
    speech = base64.b64encode(sig).decode("utf-8")
    mac_address = uuid.UUID(int=uuid.getnode()).hex[-12:]
    rate = rate
    data = {
        "format": "wav",
        "lan": "zh",
        "token": token,
        "len": speech_length,
        "rate": rate,
        "speech": speech,
        "cuid": mac_address,
        "channel": 1,
    }
    data_length = len(json.dumps(data).encode("utf-8"))
    headers = {"Content-Type": "application/json",
               "Content-Length": data_length}
    r = requests.post(url, data=json.dumps(data), headers=headers)
    print(r.text)


filename = "two.wav"

signal = open(filename, "rb").read()
rate = 8000

token = get_token()
recognize(signal, rate, token)

同时，获取语音信息可以通过：

import scipy.io.wavfile
filename = "two.wav"
rate, signal = scipy.io.wavfile.read(filename=filename)

这里写图片描述

CSDN学习社区

CSDN联合极客时间，共同打造面向开发者的精品内容学习社区，助力成长！

更多推荐

Kaldi之父，IEEE Fellow，小米首席语音科学家Daniel Povey将出席2024全球机器学习技术大会并发表演讲！

CSDN学习社区

探索神经网络在商品销售和图像识别中的应用

CSDN学习社区

基于stm32F103的座面声控台灯

CSDN学习社区

所有评论(0)

查看更多评论

面向未来的历史

@a1368783069

已为社区贡献2条内容

百度语音识别api调用 python

面向未来的历史

环境：

流程

python实现

所有评论(0)

温馨提示：您尚未绑定手机号

面向未来的历史