图像与语音接入扩展、用户分组折扣与后台配置升级
这是 OctaFuse Gateway 2.14.0 三大核心升级点的落地实操指南,包含具体配置示例、接口调用Demo和常见踩坑点,照着操作就能10分钟完成全链路升级上线。
🎨 图像与语音接入:开箱即用的配置示例
本次升级完全对齐OpenAI标准协议,无需修改客户端代码,直接新增配置即可接入全品类多模态模型。
1. 图像模型极简配置
以接入DALL-E 3、通义万相为例,在config.yaml里添加路由即可,自动适配文生图、图生图接口,默认开启超时/取消/上游失败免扣费:
yaml
models:
- id: dall-e-3
provider: openai
type: image
billing:
mode: per_image # 按张计费,自动适配图像模型
price_per_unit: 0.04 # 每张0.04元
retry:
max_retries: 1 # 上游失败自动重试1次
timeout: 30s
- id: wanx-v2
provider: dashscope
type: image
billing:
mode: per_image
price_per_unit: 0.12
配置完成后,客户端直接调用标准OpenAI接口即可,无需做任何协议转换:
bash
curl https://your-gateway/v1/images/generations \
-H "Authorization: Bearer sk-xxx" \
-d '{"model":"dall-e-3","prompt":"一只在赛博城市里的猫","size":"1024x1024"}'
2. 语音模型接入(ASR/TTS)
原生支持百炼ASR流式协议,无需额外开发代理层,直接配置即可对接DashScope、OpenAI TTS等语音服务:
yaml
models:
- id: paraformer-v2
provider: dashscope
type: asr
protocol: dashscope_audio # 自动适配原生音频流协议
billing:
mode: per_second # 按时长计费
price_per_unit: 0.002
- id: tts-1
provider: openai
type: tts
billing:
mode: per_char
price_per_unit: 0.00015
同时新增/catalog/models公开接口,客户端可以自动拉取当前网关下所有文本/图像/语音模型清单,不用手动维护模型列表,返回示例:
json
{
"object": "list",
"data": [
{"id":"gpt-4o","type":"text","owned_by":"openai"},
{"id":"dall-e-3","type":"image","owned_by":"openai"},
{"id":"paraformer-v2","type":"asr","owned_by":"dashscope"}
]
}
💰 用户分组折扣:分层配置实操
本次新增的分组折扣完全支持多层级叠加,优先级为「全局默认 < 分组倍率 < 单用户专属倍率」,批量配置效率提升10倍。
创建分组与批量绑定用户
可通过后台可视化操作,或调用管理API创建分组,支持批量导入API Key:
bash
# 创建内部研发组
curl -X POST https://your-gateway/admin/groups \
-H "X-Admin-Token: xxx" \
-d '{"name":"internal-dev","discount_rate":0.5}'
# 批量绑定API Key到分组
curl -X POST https://your-gateway/admin/groups/internal-dev/keys \
-H "X-Admin-Token: xxx" \
-d '{"keys":["sk-xxx1","sk-xxx2","sk-xxx3"]}'
精细化折扣规则配置
支持按模型类型、时段设置差异化折扣,比如给内部组配置「图像模型工作日非高峰5折、语音模型3折」:
yaml
groups:
- name: internal-dev
base_rate: 0.5
rules:
- match: {type: asr}
rate: 0.3
- match: {type: image, time_range: "00:00-08:00"}
rate: 0.2
对账明细:所有分组折扣会单独记录在账单字段discount_group中,支持按分组导出Excel明细,自动统计各部门/客户的用量和折后费用,不用手动算价。
⚙️ 后台配置升级:新功能操作指南
多模态模型一键接入向导:进入后台「模型管理 → 新增模型」,选择模型类型(文本/图像/语音),填写上游供应商API Key和模型ID,系统自动填充默认协议、计费规则配置,30秒完成新模型接入,不用手写YAML。
多模态专属用量看板:在「数据统计」页面切换到「多模态统计」标签,可分别查看图像生成张数、ASR识别时长、TTS合成字符数、文本Token用量四个维度的消耗占比,支持设置阈值告警(比如图像单日消耗超过100元自动发通知)。
移动端应急操作:手机访问后台地址无需安装App,直接支持临时切换故障上游、修改分组折扣、封禁异常API Key,线上出问题不用赶回电脑前操作。
🚀 快速升级与避坑提示
一键升级命令(Docker部署):
bash
docker pull octafuse/gateway:2.14.0
docker restart octafuse-gateway
旧版本配置会自动兼容,图像模型的计费字段会自动迁移到per_image模式,无需手动修改。
常见踩坑点:
语音ASR模型必须配置protocol: dashscope_audio,否则会默认走OpenAI协议导致流式识别失败;
分组折扣配置完成后,调用POST /admin/config/reload热加载配置即可生效,无需重启网关服务;
图像模型的timeout建议设置≥30s,避免上游生成超时导致客户端收不到结果。
升级完成后,整个网关就具备了文本、图像、语音全品类AI能力的统一接入、计费、管控能力,完全不用再单独部署多个网关分别管理不同模态的模型。
发布评论