帮助与文档 > 产品文档 > 语音识别ASR > iOS SDK 文档

有道智云语音识别 iOS SDK 文档

有道智云语音识别 SDK简介

有道智云语音识别 SDK 是有道智云开放平台提供的云服务之一,是有道在线语音识别接口的一种实现,支持在线语音识别。

通过SDK接入优势:

  1. 接入简单,不用实现整个语音识别协议
  2. 方便进行数据统计,了解用户语音识别使用情况

集成前提

开始集成SDK之前开发者需要登录有道开放平台(http://ai.youdao.com),创建应用获取应用ID(或者通过运营人员获取应用ID),以便使用识别服务。

语音识别 SDK 由如下几个 SDK 组成,用户可根据需要组合使用:

  1. FanYiSDK.h:头文件(必选)
  2. libbase.a:语音识别相关sdk基础库(必选)
  3. libspeechrecognition.a:在线语音识别 SDK(必选,使用在线语音识别时使用)

SDK 集成步骤

1. 头文件及SDK库引入(所有功能都需要这一步)

  1. 添加头文件和库文件:将语音识别 SDK 添加到工程中,包括 FanYiSDK.h头文件、libbase.a和libspeechrecognition.a文件。可以直接将translateSDK文件夹拖动到工程中,也可以选择File “Add files to ‘Project Name’…”
  2. 设置工程Other Linker Flags为-ObjC
  3. 修改工程中任意一个类后缀名为.mm,参见demo中ViewController.mm
  4. 在工程build Phases – Link Binary With Libraries中添加libbase.a, AdSupport.framework, libstc++.6.0.9.tbd, CoreTelephony.framework, SystemConfiguration, libz.tbd和libsqlite3.tbd。如下:

2. 功能集成说明

2.1 初始化key

说明:所有的查询都需要初始化key,只执行初始化一次即可。

//初始化key
YDTranslateInstance *yd = [YDTranslateInstance sharedInstance];
yd.appKey = @"your appkey";

2.2 在线语音识别功能

说明:请参考 demo 中 SpeechRecognitionViewController 的使用

1. 使用的库文件:头文件、libbase.a、libspeechrecognition.a;

2. 构造查询器

YDSpeechRecognitionRequest *request = [YDSpeechRecognitionRequest request];
YDSpeechRecognitionParam *param = [YDSpeechRecognitionParam param];
param.langType = @"zh-CHS";//源语言
param.rate = @"8000";//采样率
param.channel = @"1";//声道数,目前只支持单声道,请写固定值1
request.param = param;

3. 将语音数据转化为base64编码

NSData *speechData = [NSData dataWithContentsOfURL:self.recordFileUrl];
NSString *base64Str = [speechData base64EncodedStringWithOptions:0];

4. 执行识别过程

识别返回两种情况,一种是成功,相关结果存储在 result 参数中,另外一种是失败,失败信息放在 error,是一个枚举类,整个识别是异步的。

[request lookup:base64Str WithCompletionHandler:^(YDSpeechRecognitionRequest *request, YDSpeechRecognitionResult *result, NSError *error) {
    if (error) {
        //失败
        NSLog(@"error:%@", error);
    }else {
        //成功
        [self handleReuslt:result];
    }
}];

语音识别结果说明

对于在线语音识别,服务器查询结果返回数据如下:

{
"result": [
"今天天气不错"
],  //识别结果
"errorCode": "0",   //错误码。一定存在
}
字段 含义
result 识别结果发音地址,识别成功一定存在
errorCode 识别结果错误码,一定存在

SDK对上述json数据解析封装为YDSpeechRecognitionResult对象,如下:

@interface YDSpeechRecognitionResult : NSObject
/* 识别结果 */
@property (nonatomic, copy) NSArray *result;
/* 翻译结果错误码,一定存在 */
@property (nonatomic, copy) NSString *errorCode;

+ (instancetype)initWithDict:(NSDictionary *)info;
@end

支持语言

语言 代码
中文 zh-CHS
英文 en

格式支持:只支持wav格式。
采样率:8k或者16k。推荐16k。
编码:16bit位深的单声道

常见问题及注意事项

1. 参数错误 108

appKey无效,注册账号, 登录后台创建应用和实例并完成绑定, 可获得应用ID和密钥等信息,其中应用ID就是appKey( 注意不是应用密钥)

错误代码列表

错误码 含义
101 缺少必填的参数,出现这个情况还可能是 et 的值和实际加密方式不对应
101 缺少必填的参数
102 不支持的语言类型
103 请求文本过长
104 不支持的API类型
105 不支持的签名类型
106 不支持的响应类型
107 不支持的传输加密类型
108 appKey无效
109 batchLog格式不正确
110 无相关服务的有效实例
111 用户无效
112 请求服务无效
113 请求文本不能为空
201 解密失败
202 签名检验失败
203 访问IP地址不在可访问IP列表
301 词典查询失败
302 小语种翻译失败
303 服务的异常
401 账户已经欠费停止
402 offlinesdk不可用
411 访问频率受限,请稍后访问
412 超过最大请求字符数
4001 不支持的语音识别格式
4002 不支持的语音识别采样率
4003 不支持的语音识别声道
4004 不支持的语音上传类型
4005 不支持的语言类型
4006 识别音频文件过大
4007 识别音频时长过长
4201 解密失败
4301 语音识别失败
4303 服务的异常
4411 访问频率受限,请稍后访问
4412 超过最大请求时长

版本更新记录

上线日期版本号更新内容
2018.03.28v1.0.0支持在线语音语音识别
 
有道智云平台介绍
网易有道旗下一个为开发者、企业和政府机构等提供自然语言翻译、文字识别OCR等服务以及行业解决方案的云服务平台,致力于提供安全、可靠和高效的云服务。
联系方式
联系电话:010-8255-8901
商务合作:
投诉反馈:
地址:北京市海淀区西北旺东路10号院 中关村软件园二期西区7号 网易(北京)公司
微信公众号
 
 
 
©2017 网易公司 京ICP证080268号