OpenAI 兼容的模型推理服务
覆盖 DeepSeek、Qwen、GLM、Kimi 等主流开源模型,以及 Embedding 与 Rerank。接口遵循 OpenAI 协议,现有代码改 base_url 和 api_key 即可接入。
# 只要换掉 base_url 和 key,现有代码不用改
curl https://api.plus1compute.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $PLUS1_API_KEY" \
-d '{
"model": "qwen3-32b",
"messages": [{"role": "user", "content": "你好"}],
"stream": false
}'服务特性
OpenAI 兼容,零改造迁移
Chat Completions、Embeddings、Rerank、Function Calling、流式输出与 JSON 模式全部按 OpenAI 协议实现。现有基于 openai-python / openai-node / LangChain / LlamaIndex 的代码,改 base_url 和 api_key 两行就能跑。
算力部署在内蒙古枢纽节点
推理集群位于「东数西算」国家算力枢纽节点之一。当地风电光伏供给充沛、全年平均气温较低,数据中心的 PUE 与电力成本相应较低。
可预期的性能与配额
标准档位提供明确的并发与 QPM 配额,专属实例提供保留吞吐。首字延迟、P95 时延与可用性都有公开口径,状态页实时可查,不做「弹性但不告诉你上限」这种设计。
默认不用你的数据训练
API 请求与响应默认不写入训练集,也不用于模型改进。日志仅按合同约定的期限保留用于计费与故障排查,可申请缩短或关闭内容留存;企业协议下支持零留存模式。
模型广场
以下为当前提供的模型。新模型随上游发布持续接入。
| 模型 | 类型 | 上下文 |
|---|---|---|
DeepSeek-V3.1deepseek-v3.1 |
对话 / 通用 | 128K |
DeepSeek-R1deepseek-r1 |
深度推理 | 128K |
Qwen3-235B-A22Bqwen3-235b-a22b |
对话 / 通用 (MoE) | 128K |
Qwen3-32Bqwen3-32b |
对话 / 通用 | 128K |
Qwen3-8Bqwen3-8b |
轻量 / 高并发 | 128K |
GLM-4.6glm-4.6 |
对话 / 长文本 | 200K |
Kimi-K2-Instructkimi-k2-instruct |
对话 / 工具调用 | 128K |
Qwen3-VL-32Bqwen3-vl-32b |
多模态视觉 | 128K |
bge-m3bge-m3 |
Embedding 向量 | 8K |
Qwen3-Embedding-8Bqwen3-embedding-8b |
Embedding 向量 | 32K |
bge-reranker-v2-m3bge-reranker-v2-m3 |
Rerank 重排 | 8K |
三个最常用的调用形态
流式对话与 JSON 输出
# 流式对话 + 结构化输出
resp = client.chat.completions.create(
model="deepseek-v3.1",
messages=[
{"role": "system", "content": "你是合同审阅助手,只依据原文回答。"},
{"role": "user", "content": contract_text},
],
response_format={"type": "json_object"},
stream=True,
)
for chunk in resp:
delta = chunk.choices[0].delta.content or ""
print(delta, end="", flush=True)向量化与重排
# 向量化 + 重排,构建检索管道
vecs = client.embeddings.create(
model="bge-m3",
input=[doc.text for doc in chunks],
).data
# Rerank 走独立端点,返回按相关性排序的下标
ranked = requests.post(
"https://api.plus1compute.com/v1/rerank",
headers={"Authorization": f"Bearer {KEY}"},
json={
"model": "bge-reranker-v2-m3",
"query": question,
"documents": candidates,
"top_n": 5,
},
).json()["results"]工具调用(Function Calling)
// Function calling —— 与 OpenAI 的工具协议一致
const res = await client.chat.completions.create({
model: 'kimi-k2-instruct',
messages: [{ role: 'user', content: '查一下 3 号机组昨天的告警' }],
tools: [{
type: 'function',
function: {
name: 'query_alarms',
description: '按机组编号和日期查询告警记录',
parameters: {
type: 'object',
properties: {
unit_id: { type: 'string' },
date: { type: 'string', format: 'date' },
},
required: ['unit_id', 'date'],
},
},
}],
});三种交付形态
同一套接口,从注册即用到完全部署进你的机房,迁移不改代码。
标准服务
按实际 token 消耗结算。适合评估阶段和流量波动较大的业务。
- 标准并发与 QPM 配额
- 全部公开模型可用
- 邮件与工单支持
- 用量看板与预算告警
资源包 / 预付
预付额度在有效期内跨模型通用,不绑定单一模型。适合用量稳定、需要锁定成本的业务。
- 用量规模对应不同计价
- 提额通道优先处理
- 专属技术对接群
- 月度用量与成本报表
专属实例 / 私有化
独享 GPU 资源或完全部署到你的机房。适合数据不能出域、需要保留吞吐或有等保要求的场景。
- 保留吞吐与固定时延
- 物理隔离或完全私有化
- 国产 GPU 与信创适配
- SLA 协议与专属支持
先把检索做对,再考虑微调
绝大多数「模型不懂我们业务」的问题,根因是检索没做好或提示词没写清楚,改这两处的成本比微调低一个数量级。确实需要微调的场景是:固定输出格式、特定领域文风、把大模型蒸馏到小模型省成本。
- LoRA 与全参 SFT,支持从已有权重继续训练
- 训练数据仅用于你的专属模型,按指定时间删除
- 产出权重归你所有,可导出或托管为专属端点
- 数据不能出域时,可在私有化环境完成全流程
性能与服务口径
以上为标准档位的服务口径;具体数值随模型规模与负载浮动,专属实例可签订更高等级 SLA。实时状态见 服务状态页。