简介
Gemini Live API 支持与 Gemini 进行低延迟、实时的语音和视频交互。它能够处理连续的音频、视频或文本流,以提供即时、自然逼真的语音回答。 主要特性:- ✅ 高音质:提供多种语言的自然、逼真的语音
- ✅ 多语言支持:支持用 24 种语言进行对话
- ✅ 打断功能:用户可以随时中断模型,以便进行响应式互动
- ✅ 共情对话:根据用户输入内容的情绪表达调整回答风格和语气
- ✅ 工具使用:集成函数调用和 Google 搜索等工具
- ✅ 音频转写:提供用户输入和模型输出的文本转写内容
- ✅ 主动音频:可控制模型何时响应以及在哪些情境下响应
接口说明
端点:wss://api.leapx-hub.com/v1beta/models/{model}/liveStream
特点:
- 使用 Gemini Live API 原生格式
- 直接透传,无协议转换
- 支持 Gemini 所有原生特性
认证
string
必填
Bearer Token,如
Bearer sk-xxxxxxxxxx支持的模型
以下模型支持 Gemini Live API:音色和语言配置
音色配置
Gemini Live API 支持 30 种不同风格的预设音色,每种音色都有独特的表达特点:
默认音色:Zephyr(明快)
语言配置
支持 24 种语言,通过 BCP-47 语言代码指定:
默认语言:根据系统指令中的语言自动推断
使用示例
JavaScript 示例
Python 示例
配置示例
示例 1:仅音频模式
示例 2:音频 + 文本转录模式(推荐)
responseModalities: 响应模态,只能选择以下两种之一:["AUDIO"]- 仅音频输出["AUDIO", "TEXT"]- 音频 + 文本转录(推荐,可同时获得音频和文本)
voiceName: 音色名称,支持 30 种预设音色(见上方音色配置表)languageCode: 语言代码,支持 24 种语言(见上方语言配置表)googleSearch: 启用 Google 搜索功能proactiveAudio: 主动音频,模型可以选择不回应无关音频empatheticMode: 共情对话,根据情绪调整回答风格outputAudioTranscription: 启用输出音频转文本(需要在responseModalities中包含"TEXT"才能看到转录文本)automaticActivityDetection: 语音活动检测配置
消息类型
客户端消息
服务器消息
Token 统计
系统会分别统计:- 文本 Token(输入/输出)
- 音频 Token(输入/输出)
- 总 Token 数
usageMetadata 消息中返回:
定价说明
重要提示: 模型价格可能会变动,具体定价请以模型广场显示的最新价格为准。 Gemini Live API 按 token 计费,分别统计文本和音频 tokens:- 文本 Token:用于输入的文本内容和输出的文本转录
- 音频 Token:用于输入的音频和输出的音频内容
usageMetadata 消息中返回详细的使用量统计,包括文本和音频的输入/输出 token 数量。
技术规范
音频格式
输入音频:- 格式:16-bit PCM
- 采样率:16kHz
- 字节序:小端
- 编码:Base64
- 格式:16-bit PCM
- 采样率:24kHz
- 字节序:小端
- 编码:Base64
常见问题
如何选择音色?
如何选择音色?
在 setup 消息的
speechConfig.voiceConfig.prebuiltVoiceConfig.voiceName 中指定音色名称。支持 30 种预设音色,完整列表请查看上方的音色配置章节。默认音色为 Zephyr。如何启用音频转文本?
如何启用音频转文本?
需要同时满足两个条件:
- 在
generationConfig.responseModalities中包含"TEXT"(例如:["AUDIO", "TEXT"]) - 在 setup 消息中添加
outputAudioTranscription: {}字段
serverContent.outputTranscription 中返回音频的文本转录。如何启用 Google 搜索功能?
如何启用 Google 搜索功能?
在 setup 消息中添加
tools: { googleSearch: {} } 字段。启用后,模型可以在回答问题时搜索最新的网络信息。如何启用工具调用?
如何启用工具调用?
在 setup 消息中添加工具定义:
如何中断模型响应?
如何中断模型响应?
发送新的
realtimeInput 或 clientContent 消息会中断当前响应。支持视频输入吗?
支持视频输入吗?
是的,Gemini Live API 支持视频输入。在
clientContent 中可以包含视频数据(JPEG 格式,1 FPS)。如何获取使用量统计?
如何获取使用量统计?
系统会在响应过程中或响应完成时发送
usageMetadata 消息,包含详细的使用量统计信息。语音识别灵敏度如何配置?
语音识别灵敏度如何配置?
在 setup 消息的
realtimeInputConfig.automaticActivityDetection 中配置: