帮助与文档 > 产品文档 > 语音识别ASR > iOS SDK 文档

有道智云短语音识别 iOS SDK 文档

有道智云短语音识别 SDK简介

有道智云短语音识别 SDK 是有道智云开放平台提供的云服务之一,是有道在线语音识别接口的一种实现,支持在线语音识别。

通过SDK接入优势:

  1. 接入简单,不用实现整个语音识别协议
  2. 方便进行数据统计,了解用户语音识别使用情况

集成前提

开始集成SDK之前开发者需要登录有道开放平台(https://ai.youdao.com),创建应用获取应用ID(或者通过运营人员获取应用ID),以便使用识别服务。

语音识别 SDK 由如下几个 SDK 组成,用户可根据需要组合使用:

  1. FanYiSDK.h:头文件(必选)
  2. libbase.a:语音识别相关sdk基础库(必选)
  3. libspeechrecognition.a:在线语音识别 SDK(必选,使用在线语音识别时使用)

SDK 集成步骤

1. 头文件及SDK库引入(所有功能都需要这一步)

  1. 添加头文件和库文件:将语音识别 SDK 添加到工程中,包括 FanYiSDK.h头文件、libbase.a和libspeechrecognition.a文件。可以直接将translateSDK文件夹拖动到工程中,也可以选择File “Add files to ‘Project Name’…”
  2. 设置工程Other Linker Flags为-ObjC
  3. 修改工程中任意一个类后缀名为.mm,参见demo中ViewController.mm
  4. 在工程build Phases – Link Binary With Libraries中添加libbase.a, AdSupport.framework, libstc++.6.0.9.tbd, CoreTelephony.framework, SystemConfiguration, libz.tbd和libsqlite3.tbd。如下:

2. 功能集成说明

2.1 初始化key

说明:所有的查询都需要初始化key,只执行初始化一次即可。

//初始化key
YDTranslateInstance *yd = [YDTranslateInstance sharedInstance];
yd.appKey = @"your appkey";

2.2 在线语音识别功能

说明:请参考 demo 中 SpeechRecognitionViewController 的使用

1. 使用的库文件:头文件、libbase.a、libspeechrecognition.a;

2. 构造查询器

YDSpeechRecognitionRequest *request = [YDSpeechRecognitionRequest request];
YDSpeechRecognitionParam *param = [YDSpeechRecognitionParam param];
param.langType = @"zh-CHS";//源语言
param.rate = @"8000";//采样率
param.channel = @"1";//声道数,目前只支持单声道,请写固定值1
request.param = param;

3. 将语音数据转化为base64编码

NSData *speechData = [NSData dataWithContentsOfURL:self.recordFileUrl];
NSString *base64Str = [speechData base64EncodedStringWithOptions:0];

4. 执行识别过程

识别返回两种情况,一种是成功,相关结果存储在 result 参数中,另外一种是失败,失败信息放在 error,是一个枚举类,整个识别是异步的。

[request lookup:base64Str WithCompletionHandler:^(YDSpeechRecognitionRequest *request, YDSpeechRecognitionResult *result, NSError *error) {
    if (error) {
        //失败
        NSLog(@"error:%@", error);
    }else {
        //成功
        [self handleReuslt:result];
    }
}];

语音识别结果说明

对于在线语音识别,服务器查询结果返回数据如下:

{
"result": [
"今天天气不错"
],  //识别结果
"errorCode": "0",   //错误码。一定存在
}
字段 含义
result 识别结果发音地址,识别成功一定存在
errorCode 识别结果错误码,一定存在

SDK对上述json数据解析封装为YDSpeechRecognitionResult对象,如下:

@interface YDSpeechRecognitionResult : NSObject
/* 识别结果 */
@property (nonatomic, copy) NSArray *result;
/* 翻译结果错误码,一定存在 */
@property (nonatomic, copy) NSString *errorCode;

+ (instancetype)initWithDict:(NSDictionary *)info;
@end

支持语言

语言 代码
中文 zh-CHS
英文 en

格式支持:只支持wav格式。
采样率:8k或者16k。推荐16k。
编码:16bit位深的单声道

常见问题及注意事项

1. 参数错误 108

appKey无效,注册账号, 登录后台创建应用和实例并完成绑定, 可获得应用ID和密钥等信息,其中应用ID就是appKey( 注意不是应用密钥)

错误代码列表

错误码 含义
101 缺少必填的参数,出现这个情况还可能是 et 的值和实际加密方式不对应
101 缺少必填的参数
102 不支持的语言类型
103 请求文本过长
104 不支持的API类型
105 不支持的签名类型
106 不支持的响应类型
107 不支持的传输加密类型
108 appKey无效
109 batchLog格式不正确
110 无相关服务的有效实例
111 用户无效
112 请求服务无效
113 请求文本不能为空
201 解密失败
202 签名检验失败
203 访问IP地址不在可访问IP列表
301 词典查询失败
302 小语种翻译失败
303 服务的异常
401 账户已经欠费停止
402 offlinesdk不可用
411 访问频率受限,请稍后访问
412 超过最大请求字符数
4001 不支持的语音识别格式
4002 不支持的语音识别采样率
4003 不支持的语音识别声道
4004 不支持的语音上传类型
4005 不支持的语言类型
4006 识别音频文件过大
4007 识别音频时长过长
4201 解密失败
4301 语音识别失败
4303 服务的异常
4411 访问频率受限,请稍后访问
4412 超过最大请求时长

版本更新记录

上线日期版本号更新内容
2018.03.28v1.0.0支持在线语音语音识别

1.简介

Hi,您好,欢迎使用有道智云实时语音识别服务。

本文档主要针对需要集成iOS SDK的技术开发工程师,详细描述实时语音识别能力相关的技术内容。

如果您有与我们商务合作的需求,可以通过一下方式联系我们:

商务邮箱: AIcloud_Business@corp.youdao.com

如果您对文档内容有任何疑问,可以通过以下几种方式联系我们:

客服QQ:1906538062

官方交流群:652880659

联系邮箱: zyservice@corp.youdao.com

下面是接口接入文档,接入测试需要应用ID,如果您还没有,请按照新手指南获取。

集成前提

开始集成SDK之前开发者需要登录有道开放平台(https://ai.youdao.com),创建应用获取应用ID(或者通过运营人员获取应用ID),以便使用识别服务。

语音识别 SDK 由如下几个 SDK 组成,用户可根据需要组合使用:

  1. FanYiSDK.h:头文件(必选)
  2. libbase.a:语音识别相关sdk基础库(必选)
  3. libStreamASR.a.a:流式语音识别SDK(可选,实时语音识别功能)

SDK 集成步骤

1. 头文件及SDK库引入(所有功能都需要这一步)

  1. 添加头文件和库文件:将语音识别 SDK 添加到工程中,包括 FanYiSDK.h头文件、libbase.a和libspeechrecognition.a文件。可以直接将translateSDK文件夹拖动到工程中,也可以选择File “Add files to ‘Project Name’…”
  2. 设置工程Other Linker Flags为-ObjC
  3. 修改工程中任意一个类后缀名为.mm,参见demo中ViewController.mm
  4. 在工程build Phases – Link Binary With Libraries中添加libbase.a, AdSupport.framework, libstc++.6.0.9.tbd, CoreTelephony.framework, SystemConfiguration, libz.tbd和libsqlite3.tbd。如下:

2. 功能集成说明

2.1 初始化key

说明:所有的查询都需要初始化key,只执行初始化一次即可。

//初始化key
YDTranslateInstance *yd = [YDTranslateInstance sharedInstance];
yd.appKey = @"your appkey";

2.2 在线语音识别功能

说明:支持实时流式语音识别,目前支持中英文,请参考 demo 中 StreamASRController 的使用

1. 使用的库文件:头文件、libbase.a、libStreamASR.a;

2. 构造识别器

YDSpeechRecognizer *recognizer = [YDSpeechRecognizer sharedRecognizer];
recognizer.delegate = self;

3. 设置识别所需要的附加信息

YDSpeechRecognizerParam *param = [YDSpeechRecognizerParam param];
param.langType = @"zh-CHS";//源语言
param.rate = @"16000";//采样率
param.format = @"wav";//语音文件格式
param.vadBOS = 2000;//前端点静音检测时长,ms
param.vadEOS = 2000;//后端点静音检测时长,ms
recognizer.param = param;

4. 执行语音识别过程

执行[self.recognizer startListening];开始流式语音识别,结果将在代理方法中回调给开发者;

#pragma mark - speech recognizer delegate
- (void)onBeginOfSpeech {
    [self startSpeakingAnimation];
    NSLog(@"------speech start-----");
}

- (void)onEndOfSpeech {
    [self endSpekingAnimation];
    NSLog(@"------speech end-----");
}

- (void)onResults:(NSDictionary *)result isLast:(BOOL)isLast {
    NSString *sentence = result[@"sentence"];
    self.recognizedLabel.text = [NSString stringWithFormat:@"%@%@", self.displayingText, sentence];
    if (isLast) {
        [self.displayingText appendString:sentence];
    }
}

- (void)onCompleted:(NSError *)speechError {
    [self endSpekingAnimation];
    NSLog(@"------speech completed-----");
}

- (void)onConstantlyQuietIsBOS:(BOOL)isBOS {
    NSLog(@"检测到%@静音", isBOS ? @"前端点" : @"后端点");
}

语音识别结果说明

识别结果示例:

{
    "result": [{
        "st": [{
            "bg": 30,
            "ed": 480,
            "ws": [{
                "w": "Have",
                "wb": 30,
                "we": 240
            }, {
                "w": "a",
                "wb": 240,
                "we": 270
            }, {
                "w": "good",
                "wb": 270,
                "we": 480
            }, {
                "w": "day.",
                "wb": 480,
                "we": 480
            }]
        }],
        "seg_id": 0
    }],
    "errorCode": "0",
    "action": "recognition"
}

识别结果 result 参数说明:

参数含义说明
bg分句开始时间单位毫秒/ms
ed分句结束时间单位毫秒/ms
w词(字)识别结果
wb词(字)开始时间单位毫秒/ms
we词(字)结束时间单位毫秒/ms
type识别结果类型0:最终结果,1:中间结果
seg_id分句 id从 0 开始递增

支持的语言表

支持中文和其他几种语言的互译。

语言代码
中文zh-CHS
英文en

常见问题

  • 返回110

应用没有绑定服务实例,可以新建服务实例,绑定服务实例。

  • 返回108

appKey无效,注册账号, 登录后台创建应用和实例并完成绑定, 可获得应用ID和密钥等信息,其中应用ID就是appKey( 注意不是应用密钥)

  • 返回101

首先确保必填参数齐全,然后,确认参数书写是否正确。

  • 返回202

如果确认 appKeyappSecret 的正确性,仍返回202,一般是编码问题。请确保 q 为UTF-8编码.

版本记录

上线日期版本号更新内容
2018.11.07v1.0.0有道智云实时语音识别上线
文档是否有帮助解决问题?

如有其它疑问,可在此提交意见和反馈
详细描述(选填)
联系邮箱(选填)
 
有道智云平台介绍
网易有道旗下一个为开发者、企业和政府机构等提供自然语言翻译、文字识别OCR等服务以及行业解决方案的云服务平台,致力于提供安全、可靠和高效的云服务。
联系方式
联系电话:010-8255-8901
商务合作:
投诉反馈:
地址:北京市海淀区西北旺东路10号院 中关村软件园二期西区7号 网易(北京)公司
微信公众号
微信小程序
 
 
 
©2017 网易公司 京ICP证080268号