帮助与文档 > 产品文档 > 语音识别ASR > iOS SDK 文档

有道智云语音识别 iOS SDK 文档

有道智云语音识别 SDK简介

有道智云语音识别 SDK 是有道智云开放平台提供的云服务之一,是有道在线语音识别接口的一种实现,支持在线语音识别。

通过SDK接入优势:

  1. 接入简单,不用实现整个语音识别协议
  2. 方便进行数据统计,了解用户语音识别使用情况

集成前提

开始集成SDK之前开发者需要登录有道开放平台(http://ai.youdao.com),创建应用获取应用ID(或者通过运营人员获取应用ID),以便使用识别服务。

语音识别 SDK 由如下几个 SDK 组成,用户可根据需要组合使用:

  1. FanYiSDK.h:头文件(必选)
  2. libbase.a:语音识别相关sdk基础库(必选)
  3. libspeechrecognition.a:在线语音识别 SDK(必选,使用在线语音识别时使用)

SDK 集成步骤

1. 头文件及SDK库引入(所有功能都需要这一步)

  1. 添加头文件和库文件:将语音识别 SDK 添加到工程中,包括 FanYiSDK.h头文件、libbase.a和libspeechrecognition.a文件。
  2. 设置工程Other Linker Flags为-ObjC
  3. 在工程build Phases – Link Binary With Libraries中添加libbase.a, AdSupport.framework, CoreTelephony.framework, SystemConfiguration, libz.tbd和libsqlite3.tbd。

2. 功能集成说明

2.1 初始化key

说明:所有的查询都需要初始化key,只执行初始化一次即可。

//初始化key
YDTranslateInstance *yd = [YDTranslateInstance sharedInstance];
yd.appKey = @"your appkey";

2.2 在线语音识别功能

说明:支持最长15秒的短语音在线识别功能,请参考 demo 中 SpeechRecognitionViewController 的使用;

1. 使用的库文件:头文件、libbase.a、libspeechrecognition.a;

2. 构造查询器

YDSpeechRecognitionRequest *request = [YDSpeechRecognitionRequest request];
YDSpeechRecognitionParam *param = [YDSpeechRecognitionParam param];
param.langType = @"zh-CHS";//源语言
param.rate = @"8000";//采样率
param.channel = @"1";//声道数,目前只支持单声道,请写固定值1
request.param = param;

3. 将语音数据转化为base64编码

NSData *speechData = [NSData dataWithContentsOfURL:self.recordFileUrl];
NSString *base64Str = [speechData base64EncodedStringWithOptions:0];

4. 执行识别过程

识别返回两种情况,一种是成功,相关结果存储在 result 参数中,另外一种是失败,失败信息放在 error,是一个枚举类。

[request lookup:base64Str WithCompletionHandler:^(YDSpeechRecognitionRequest *request, YDSpeechRecognitionResult *result, NSError *error) {
    if (error) {
        //失败
        NSLog(@"error:%@", error);
    }else {
        //成功
        [self handleReuslt:result];
    }
}];

语音识别结果说明

对于在线语音识别,服务器查询结果返回数据如下:

{
"result": [
"今天天气不错"
],  //识别结果
"errorCode": "0",   //错误码。一定存在
}
字段含义
result识别结果发音地址,识别成功一定存在
errorCode识别结果错误码,一定存在

SDK demo对上述json数据解析封装为YDSpeechRecognitionResult对象,如下:

@interface YDSpeechRecognitionResult : NSObject
/* 识别结果 */
@property (nonatomic, copy) NSArray *result;
/* 翻译结果错误码,一定存在 */
@property (nonatomic, copy) NSString *errorCode;

+ (instancetype)initWithDict:(NSDictionary *)info;
@end

支持语言

语言代码
中文zh-CHS
英文en

格式支持:只支持wav格式。
采样率:8k或者16k。推荐16k。
编码:16bit位深的单声道

常见问题及注意事项

1. 参数错误 108

appKey无效,注册账号, 登录后台创建应用和实例并完成绑定, 可获得应用ID和密钥等信息,其中应用ID就是appKey( 注意不是应用密钥)

错误代码列表

错误码含义
101缺少必填的参数,出现这个情况还可能是 et 的值和实际加密方式不对应
101缺少必填的参数
102不支持的语言类型
103请求文本过长
104不支持的API类型
105不支持的签名类型
106不支持的响应类型
107不支持的传输加密类型
108appKey无效
109batchLog格式不正确
110无相关服务的有效实例
111用户无效
112请求服务无效
113请求文本不能为空
201解密失败
202签名检验失败
203访问IP地址不在可访问IP列表
301词典查询失败
302小语种翻译失败
303服务的异常
401账户已经欠费停止
402offlinesdk不可用
411访问频率受限,请稍后访问
412超过最大请求字符数
4001不支持的语音识别格式
4002不支持的语音识别采样率
4003不支持的语音识别声道
4004不支持的语音上传类型
4005不支持的语言类型
4006识别音频文件过大
4007识别音频时长过长
4201解密失败
4301语音识别失败
4303服务的异常
4411访问频率受限,请稍后访问
4412超过最大请求时长

有道智云流式语音识别 iOS SDK 文档

有道智云流式语音识别 SDK简介

有道智云流式语音识别 SDK 是有道智云开放平台提供的云服务之一,是有道在线流式语音识别接口的一种实现,支持在线流式语音识别。

通过SDK接入优势:

  1. 接入简单,不用实现整个流式语音识别协议
  2. 方便进行数据统计,了解用户流式语音识别使用情况

集成前提

开始集成SDK之前开发者需要登录有道开放平台(http://ai.youdao.com),创建应用获取应用ID(或者通过运营人员获取应用ID),以便使用评测服务。

流式语音识别 SDK 由如下几个 SDK 组成,用户可根据需要组合使用:

  1. FanYiSDK.h:头文件(必选)
  2. libbase.a:流式语音识别相关sdk基础库(必选)
  3. libStreamASR.a:在线流式语音识别 SDK(必选,使用在线流式语音识别时使用)

SDK 集成步骤

1. 头文件及SDK库引入(所有功能都需要这一步)

  1. 添加头文件和库文件:将流式语音识别 SDK 添加到工程中,包括 FanYiSDK.h头文件、libbase.a和libStreamASR.a文件。
  2. 设置工程Other Linker Flags为-ObjC
  3. 在工程build Phases – Link Binary With Libraries中添加libbase.a, AdSupport.framework, CoreTelephony.framework, SystemConfiguration, libz.tbd和libsqlite3.tbd。

2. 功能集成说明

2.1 初始化key

说明:所有的查询都需要初始化key,只执行初始化一次即可。

//初始化key
YDTranslateInstance *yd = [YDTranslateInstance sharedInstance];
yd.appKey = @"your appkey";

2.2 在线流式语音识别功能

说明:支持实时流式语音识别,目前支持中英文,请参考 demo 中 StreamASRController 的使用;

1. 使用的库文件:头文件、libbase.a、libStreamASR.a;

2. 构造识别器

YDSpeechRecognizer *recognizer = [YDSpeechRecognizer sharedRecognizer];
recognizer.delegate = self;

3. 设置识别所需要的附加信息

YDSpeechRecognizerParam *param = [YDSpeechRecognizerParam param];
param.langType = @"zh-CHS";//源语言
param.rate = @"16000";//采样率
param.format = @"wav";//语音文件格式
param.vadBOS = 2000;//前端点静音检测时长,ms
param.vadEOS = 2000;//后端点静音检测时长,ms
recognizer.param = param;

4. 执行语音识别过程

执行[self.recognizer startListening];开始流式语音识别,结果将在代理方法中回调给开发者;

#pragma mark - speech recognizer delegate
- (void)onBeginOfSpeech {
  [self startSpeakingAnimation];
  NSLog(@"------speech start-----");
}

- (void)onEndOfSpeech {
  [self endSpekingAnimation];
  NSLog(@"------speech end-----");
}

- (void)onResults:(NSDictionary *)result isLast:(BOOL)isLast {
  NSString *sentence = result[@"sentence"];
  self.recognizedLabel.text = [NSString stringWithFormat:@"%@%@", self.displayingText, sentence];
  if (isLast) {
    [self.displayingText appendString:sentence];
  }
}

- (void)onCompleted:(NSError *)speechError {
  [self endSpekingAnimation];
  NSLog(@"------speech completed-----");
}

- (void)onConstantlyQuietIsBOS:(BOOL)isBOS {
  NSLog(@"检测到%@静音", isBOS ? @"前端点" : @"后端点");
}

支持语言

语言代码
中文zh-CHS
英文en

错误码

错误码含义
101缺少必填的参数,出现这个情况还可能是 et 的值和实际加密方式不对应
102不支持的语言类型
103翻译文本过长
104不支持的 API 类型
105不支持的签名类型
106不支持的响应类型
107不支持的传输加密类型
108appKey 无效,注册账号, 登录后台创建应用和实例并完成绑定, 可获得应用ID和密钥等信息,其中应用ID就是appKey( 注意不是应用密钥)
109batchLog 格式不正确
110无相关服务的有效实例
111开发者账号无效,可能是账号为欠费状态
201解密失败,可能为 DES,BASE64,URLDecode 的错误
202签名检验失败
203访问 IP 地址不在可访问 IP 列表
301辞典查询失败
302翻译查询失败
303服务端的其它异常
401账户已经欠费停
-1000未知错误
-2000查询输入为空
文档是否有帮助解决问题?

如有其它疑问,可在此提交意见和反馈
详细描述(选填)
联系邮箱(选填)
 
有道智云平台介绍
网易有道信息技术(北京)有限公司旗下的一个为开发者、企业和政府机构等提供自然语言翻译、文字识别OCR等服务以及行业解决方案的云服务平台,致力于提供安全、可靠和高效的云服务。
联系方式
联系电话:010-8255-8901
商务合作:
投诉反馈:
地址:北京市海淀区西北旺东路10号院 中关村软件园二期西区7号 网易(北京)公司
微信公众号
微信小程序
 
 
 
©2017 网易公司 京ICP证080268号