API 参考
音频接口(TTS / STT)
通过 OpenAI 兼容接口完成文字转语音与语音转文字。
FIM Gate 提供 OpenAI 兼容的音频接口,覆盖两类场景:
- 文字转语音(TTS):输入文本,返回音频文件
- 语音转文字(STT):上传音频文件,返回识别文本
基础信息
| 项目 | 值 |
|---|---|
| Base URL | https://api.gate.fim.ai/v1 |
| 鉴权方式 | 请求头 Authorization: Bearer $FIM_API_KEY |
文字转语音(Speech)
POST /v1/audio/speech
请求体为 JSON,接口直接返回二进制音频流,可重定向到文件保存。
请求参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
model | string | 是 | TTS 模型 ID,如 tts-1 |
input | string | 是 | 要合成的文本,支持中文 |
voice | string | 是 | 音色名称,如 alloy |
response_format | string | 否 | 输出格式,如 mp3、wav |
speed | number | 否 | 语速倍率 |
当前可用的 TTS 模型:tts-1、tts-1-hd、gpt-4o-mini-tts、gemini-2.5-flash-preview-tts、gemini-2.5-pro-preview-tts。完整列表见 gate.fim.ai/pricing。
请求示例
curl https://api.gate.fim.ai/v1/audio/speech \
-H "Authorization: Bearer $FIM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1",
"input": "欢迎使用 FIM Gate,一行配置接入多家模型。",
"voice": "alloy"
}' \
--output welcome.mp3请求成功后,当前目录会生成 welcome.mp3。
语音转文字(Transcriptions)
POST /v1/audio/transcriptions
请求体为 multipart/form-data,需上传音频文件。
请求参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
file | file | 是 | 待识别的音频文件(如 mp3、wav、m4a) |
model | string | 是 | 识别模型 ID,如 whisper-1 |
language | string | 否 | 音频语言(ISO-639-1,如 zh),可提升准确率 |
prompt | string | 否 | 提示文本,用于引导识别风格或专有名词 |
response_format | string | 否 | 返回格式,如 json、text、srt |
temperature | number | 否 | 采样温度,0 至 1 |
当前可用的识别模型:whisper-1。完整列表见 gate.fim.ai/pricing。
请求示例
curl https://api.gate.fim.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $FIM_API_KEY" \
-H "Content-Type: multipart/form-data" \
-F file=@./meeting.mp3 \
-F model=whisper-1响应示例
{
"text": "这里是识别出的文字内容。"
}常见问题
- TTS 返回的是二进制流,记得用
--output或等价方式落盘,不要按 JSON 解析。 - STT 上传大文件时请留意客户端超时设置,必要时先做切分。