产品
解决方案
定价
开发者
公司
联系我们
MaaS 模型即服务

OpenAI 兼容的模型推理服务

覆盖 DeepSeek、Qwen、GLM、Kimi 等主流开源模型,以及 Embedding 与 Rerank。接口遵循 OpenAI 协议,现有代码改 base_url 和 api_key 即可接入。

migrate.sh
# 只要换掉 base_url 和 key,现有代码不用改
curl https://api.plus1compute.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $PLUS1_API_KEY" \
  -d '{
    "model": "qwen3-32b",
    "messages": [{"role": "user", "content": "你好"}],
    "stream": false
  }'
服务特性

服务特性

OpenAI 兼容,零改造迁移

Chat Completions、Embeddings、Rerank、Function Calling、流式输出与 JSON 模式全部按 OpenAI 协议实现。现有基于 openai-python / openai-node / LangChain / LlamaIndex 的代码,改 base_url 和 api_key 两行就能跑。

算力部署在内蒙古枢纽节点

推理集群位于「东数西算」国家算力枢纽节点之一。当地风电光伏供给充沛、全年平均气温较低,数据中心的 PUE 与电力成本相应较低。

可预期的性能与配额

标准档位提供明确的并发与 QPM 配额,专属实例提供保留吞吐。首字延迟、P95 时延与可用性都有公开口径,状态页实时可查,不做「弹性但不告诉你上限」这种设计。

默认不用你的数据训练

API 请求与响应默认不写入训练集,也不用于模型改进。日志仅按合同约定的期限保留用于计费与故障排查,可申请缩短或关闭内容留存;企业协议下支持零留存模式。

模型列表

模型广场

以下为当前提供的模型。新模型随上游发布持续接入。

模型 类型 上下文
DeepSeek-V3.1deepseek-v3.1
对话 / 通用 128K
DeepSeek-R1deepseek-r1
深度推理 128K
Qwen3-235B-A22Bqwen3-235b-a22b
对话 / 通用 (MoE) 128K
Qwen3-32Bqwen3-32b
对话 / 通用 128K
Qwen3-8Bqwen3-8b
轻量 / 高并发 128K
GLM-4.6glm-4.6
对话 / 长文本 200K
Kimi-K2-Instructkimi-k2-instruct
对话 / 工具调用 128K
Qwen3-VL-32Bqwen3-vl-32b
多模态视觉 128K
bge-m3bge-m3
Embedding 向量 8K
Qwen3-Embedding-8Bqwen3-embedding-8b
Embedding 向量 32K
bge-reranker-v2-m3bge-reranker-v2-m3
Rerank 重排 8K
关于价格

计价方式取决于用量规模、部署形态与合作方式,请联系我们获取报价。模型列表随上游发布更新,当前可用版本请查阅 API 文档

代码示例

三个最常用的调用形态

流式对话与 JSON 输出

chat.py
# 流式对话 + 结构化输出
resp = client.chat.completions.create(
    model="deepseek-v3.1",
    messages=[
        {"role": "system", "content": "你是合同审阅助手,只依据原文回答。"},
        {"role": "user",   "content": contract_text},
    ],
    response_format={"type": "json_object"},
    stream=True,
)
for chunk in resp:
    delta = chunk.choices[0].delta.content or ""
    print(delta, end="", flush=True)

向量化与重排

retrieve.py
# 向量化 + 重排,构建检索管道
vecs = client.embeddings.create(
    model="bge-m3",
    input=[doc.text for doc in chunks],
).data

# Rerank 走独立端点,返回按相关性排序的下标
ranked = requests.post(
    "https://api.plus1compute.com/v1/rerank",
    headers={"Authorization": f"Bearer {KEY}"},
    json={
        "model": "bge-reranker-v2-m3",
        "query": question,
        "documents": candidates,
        "top_n": 5,
    },
).json()["results"]

工具调用(Function Calling)

tools.ts
// Function calling —— 与 OpenAI 的工具协议一致
const res = await client.chat.completions.create({
  model: 'kimi-k2-instruct',
  messages: [{ role: 'user', content: '查一下 3 号机组昨天的告警' }],
  tools: [{
    type: 'function',
    function: {
      name: 'query_alarms',
      description: '按机组编号和日期查询告警记录',
      parameters: {
        type: 'object',
        properties: {
          unit_id: { type: 'string' },
          date:    { type: 'string', format: 'date' },
        },
        required: ['unit_id', 'date'],
      },
    },
  }],
});
交付形态

三种交付形态

同一套接口,从注册即用到完全部署进你的机房,迁移不改代码。

标准服务

按实际 token 消耗结算。适合评估阶段和流量波动较大的业务。

  • 标准并发与 QPM 配额
  • 全部公开模型可用
  • 邮件与工单支持
  • 用量看板与预算告警

资源包 / 预付

预付额度在有效期内跨模型通用,不绑定单一模型。适合用量稳定、需要锁定成本的业务。

  • 用量规模对应不同计价
  • 提额通道优先处理
  • 专属技术对接群
  • 月度用量与成本报表

专属实例 / 私有化

独享 GPU 资源或完全部署到你的机房。适合数据不能出域、需要保留吞吐或有等保要求的场景。

  • 保留吞吐与固定时延
  • 物理隔离或完全私有化
  • 国产 GPU 与信创适配
  • SLA 协议与专属支持
模型微调

先把检索做对,再考虑微调

绝大多数「模型不懂我们业务」的问题,根因是检索没做好或提示词没写清楚,改这两处的成本比微调低一个数量级。确实需要微调的场景是:固定输出格式、特定领域文风、把大模型蒸馏到小模型省成本。

  • LoRA 与全参 SFT,支持从已有权重继续训练
  • 训练数据仅用于你的专属模型,按指定时间删除
  • 产出权重归你所有,可导出或托管为专属端点
  • 数据不能出域时,可在私有化环境完成全流程

性能与服务口径

可用性目标99.9% / 月
首字延迟 (TTFT)< 400 ms (P50)
输出速率30–80 tok/s
标准并发64
标准 QPM600
数据用于训练否(默认)
零留存模式企业协议支持

以上为标准档位的服务口径;具体数值随模型规模与负载浮动,专属实例可签订更高等级 SLA。实时状态见 服务状态页

怎么获取价格?
计价取决于用量规模、模型选择与部署形态,请联系我们获取报价。提供预估的日请求量、平均输入输出长度与倾向选用的模型,通常一到两个工作日内可以给出。
上下文长度和最大输出是多少?
各模型的上下文窗口见模型表格。默认单次最大输出为 8K token,可在请求中通过 max_tokens 调整,上限随模型不同。超长文档建议走分段 + 检索而不是硬塞进上下文——既省钱,效果通常也更好。
怎么开始测试?
企业账号可申请一次性测试额度,足够跑通接入并做一轮小规模评测。如果你在做选型对比,可以联系我们——我们能按你的评测集提供对比测试支持,包括把 prompt 在不同模型上调到可比状态。
服务不可用的时候怎么办?
标准档位的可用性目标是月度 99.9%,专属实例可签更高等级的 SLA 并约定赔偿条款。我们建议客户端配置降级策略:主模型不可用时自动切换到备用模型或备用供应商——文档里提供了示例代码,包括切换到其他供应商的写法。运维事件会在状态页公告并邮件通知。
能微调吗?微调的数据安全怎么保证?
支持 LoRA 与全参 SFT,训练数据仅用于你的专属模型,训练结束后按你的指定时间删除,全过程有审计日志。微调后的权重归你所有,可以导出,也可以托管为专属端点。如果连训练数据都不能出域,可以在私有化环境里完成微调,我们提供工具链和现场支持。

用你自己的评测集测一轮

我们可以提供测试额度,你用真实的 prompt 和评测集跑一遍,再决定是否值得继续沟通。

响应时间:工作日一个工作日内 · 支持中文 / English

本站仅使用必要的本地存储来记住你的语言与主题偏好,不投放广告类 Cookie。详见隐私政策

了解更多