FIM Gate 文档
API 参考

音频接口(TTS / STT)

通过 OpenAI 兼容接口完成文字转语音与语音转文字。

FIM Gate 提供 OpenAI 兼容的音频接口,覆盖两类场景:

  • 文字转语音(TTS):输入文本,返回音频文件
  • 语音转文字(STT):上传音频文件,返回识别文本

基础信息

项目值
Base URLhttps://api.gate.fim.ai/v1
鉴权方式请求头 Authorization: Bearer $FIM_API_KEY

文字转语音(Speech)

POST /v1/audio/speech

请求体为 JSON,接口直接返回二进制音频流,可重定向到文件保存。

请求参数

参数类型必填说明
modelstring是TTS 模型 ID,如 tts-1
inputstring是要合成的文本,支持中文
voicestring是音色名称,如 alloy
response_formatstring否输出格式,如 mp3、wav
speednumber否语速倍率

当前可用的 TTS 模型:tts-1、tts-1-hd、gpt-4o-mini-tts、gemini-2.5-flash-preview-tts、gemini-2.5-pro-preview-tts。完整列表见 gate.fim.ai/pricing。

请求示例

curl https://api.gate.fim.ai/v1/audio/speech \
  -H "Authorization: Bearer $FIM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1",
    "input": "欢迎使用 FIM Gate,一行配置接入多家模型。",
    "voice": "alloy"
  }' \
  --output welcome.mp3

请求成功后,当前目录会生成 welcome.mp3。

语音转文字(Transcriptions)

POST /v1/audio/transcriptions

请求体为 multipart/form-data,需上传音频文件。

请求参数

参数类型必填说明
filefile是待识别的音频文件(如 mp3、wav、m4a)
modelstring是识别模型 ID,如 whisper-1
languagestring否音频语言(ISO-639-1,如 zh),可提升准确率
promptstring否提示文本,用于引导识别风格或专有名词
response_formatstring否返回格式,如 json、text、srt
temperaturenumber否采样温度,0 至 1

当前可用的识别模型:whisper-1。完整列表见 gate.fim.ai/pricing。

请求示例

curl https://api.gate.fim.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $FIM_API_KEY" \
  -H "Content-Type: multipart/form-data" \
  -F file=@./meeting.mp3 \
  -F model=whisper-1

响应示例

{
  "text": "这里是识别出的文字内容。"
}

常见问题

  • TTS 返回的是二进制流,记得用 --output 或等价方式落盘,不要按 JSON 解析。
  • STT 上传大文件时请留意客户端超时设置,必要时先做切分。