Skip to main content

简介

Gemini Live API 支持与 Gemini 进行低延迟、实时的语音和视频交互。它能够处理连续的音频、视频或文本流,以提供即时、自然逼真的语音回答。 主要特性:
  • ✅ 高音质:提供多种语言的自然、逼真的语音
  • ✅ 多语言支持:支持用 24 种语言进行对话
  • ✅ 打断功能:用户可以随时中断模型,以便进行响应式互动
  • ✅ 共情对话:根据用户输入内容的情绪表达调整回答风格和语气
  • ✅ 工具使用:集成函数调用和 Google 搜索等工具
  • ✅ 音频转写:提供用户输入和模型输出的文本转写内容
  • ✅ 主动音频:可控制模型何时响应以及在哪些情境下响应

接口说明

端点: wss://api.leapx-hub.com/v1beta/models/{model}/liveStream 特点:
  • 使用 Gemini Live API 原生格式
  • 直接透传,无协议转换
  • 支持 Gemini 所有原生特性
示例:

认证

string
必填
Bearer Token,如 Bearer sk-xxxxxxxxxx

支持的模型

以下模型支持 Gemini Live API:

音色和语言配置

音色配置

Gemini Live API 支持 30 种不同风格的预设音色,每种音色都有独特的表达特点: 默认音色:Zephyr(明快)

语言配置

支持 24 种语言,通过 BCP-47 语言代码指定: 默认语言:根据系统指令中的语言自动推断

使用示例

JavaScript 示例

Python 示例

配置示例

示例 1:仅音频模式

示例 2:音频 + 文本转录模式(推荐)

配置说明:
  • responseModalities: 响应模态,只能选择以下两种之一:
    • ["AUDIO"] - 仅音频输出
    • ["AUDIO", "TEXT"] - 音频 + 文本转录(推荐,可同时获得音频和文本)
  • voiceName: 音色名称,支持 30 种预设音色(见上方音色配置表)
  • languageCode: 语言代码,支持 24 种语言(见上方语言配置表)
  • googleSearch: 启用 Google 搜索功能
  • proactiveAudio: 主动音频,模型可以选择不回应无关音频
  • empatheticMode: 共情对话,根据情绪调整回答风格
  • outputAudioTranscription: 启用输出音频转文本(需要在 responseModalities 中包含 "TEXT" 才能看到转录文本)
  • automaticActivityDetection: 语音活动检测配置

消息类型

客户端消息

服务器消息

Token 统计

系统会分别统计:
  • 文本 Token(输入/输出)
  • 音频 Token(输入/输出)
  • 总 Token 数
使用量信息会在 usageMetadata 消息中返回:

定价说明

重要提示: 模型价格可能会变动,具体定价请以模型广场显示的最新价格为准。 Gemini Live API 按 token 计费,分别统计文本和音频 tokens:
  • 文本 Token:用于输入的文本内容和输出的文本转录
  • 音频 Token:用于输入的音频和输出的音频内容
系统会在 usageMetadata 消息中返回详细的使用量统计,包括文本和音频的输入/输出 token 数量。

技术规范

音频格式

输入音频:
  • 格式:16-bit PCM
  • 采样率:16kHz
  • 字节序:小端
  • 编码:Base64
输出音频:
  • 格式:16-bit PCM
  • 采样率:24kHz
  • 字节序:小端
  • 编码:Base64

常见问题

在 setup 消息的 speechConfig.voiceConfig.prebuiltVoiceConfig.voiceName 中指定音色名称。支持 30 种预设音色,完整列表请查看上方的音色配置章节。默认音色为 Zephyr。
需要同时满足两个条件:
  1. generationConfig.responseModalities 中包含 "TEXT"(例如:["AUDIO", "TEXT"]
  2. 在 setup 消息中添加 outputAudioTranscription: {} 字段
启用后,服务器会在 serverContent.outputTranscription 中返回音频的文本转录。
在 setup 消息中添加 tools: { googleSearch: {} } 字段。启用后,模型可以在回答问题时搜索最新的网络信息。
在 setup 消息中添加工具定义:
发送新的 realtimeInputclientContent 消息会中断当前响应。
是的,Gemini Live API 支持视频输入。在 clientContent 中可以包含视频数据(JPEG 格式,1 FPS)。
系统会在响应过程中或响应完成时发送 usageMetadata 消息,包含详细的使用量统计信息。
在 setup 消息的 realtimeInputConfig.automaticActivityDetection 中配置:

参考文档