平台能力
怎么跑、知道什么、准不准、出问题怎么查。
可视化画布编排
拖拽式配置节点:模型调用、条件分支、循环、并行、人工审核关卡。业务同学能自己改提示词和分支条件,不必每次都排研发工期。
Python SDK 接管
复杂逻辑不必削足适履。任何节点都能替换成自定义代码,画布与代码共享同一运行时和同一份 trace,不存在两套实现。
多智能体协作
支持 Supervisor / Worker、辩论式复核、任务分解等模式,并对每个子 Agent 单独设置模型、超时与成本上限,避免失控递归。
状态与长任务
支持跨天的长流程:断点续跑、外部事件唤醒、人工介入后继续。状态持久化在 PostgreSQL,不依赖内存,重启不丢。
多格式解析入库
PDF(含扫描件 OCR)、Word / Excel / PPT、HTML、Markdown、以及数据库表和工单系统。表格与版式复杂的工程图纸单独走专用解析链路。
混合检索与重排
向量检索 + BM25 关键词 + 元数据过滤三路召回,再用 reranker 精排。中文专业术语和型号编码这类场景,纯向量检索的召回率通常不够。
行级权限隔离
检索结果按调用者身份过滤。同一个问题,不同部门、不同职级的人看到的依据文档不同——这是企业内部落地绕不过去的一关。
增量同步与失效
文档更新后自动重新切分并失效旧向量,支持定时与 Webhook 触发。过期知识给出的答案比没有答案更危险。
评测集管理
支持人工标注、线上 badcase 回流、以及 LLM 辅助生成三种来源。评测集是项目资产,导出格式开放,归客户所有。
回归与 A/B
改动前后自动跑全量评测并给出逐项 diff:哪些题变对了、哪些变错了。支持影子流量对比新旧版本,不影响线上用户。
在线质量监控
对生产流量做抽样评分、拒答率与幻觉信号监控,异常自动告警。上线不是终点,模型和数据都会漂移。
人工审核工作台
高风险场景可配置人工复核队列,审核结论直接回流评测集,形成「上线→纠错→变准」的闭环而不是一次性交付。
身份与组织同步
对接 LDAP / AD、企业微信、钉钉、飞书与标准 OIDC。组织架构变动自动同步,权限跟着人走。
渠道接入
同一个 Agent 可同时发布到企业微信 / 钉钉 / 飞书机器人、网页组件、内部系统嵌入,以及标准 REST API。
可观测性
每次调用的完整 trace:提示词、检索命中、工具入参出参、token 与耗时分解。通过 OpenTelemetry 导出到你现有的 Grafana / 云监控。
成本治理
按部门、项目、用户维度统计 token 消耗并设置配额与告警阈值。缓存命中、小模型分流与提示词压缩都在平台侧完成。
每一层都可以替换
模型层可以指向我们的 MaaS、你自建的推理服务或第三方 API;向量库、身份系统、消息渠道都走标准协议。目的是让你在两年后仍然有选择权。
全部五层都支持部署在你的机房或专有云,含国产 GPU 与信创操作系统适配。
三种合作方式
还在评估可行性、已经确定要做、还是已经上线需要人接住。
验证性项目 (PoV)
适用于还不确定 AI 能否解决问题的阶段。用你的真实数据做可运行原型并建立评测基线,得出有数字支撑的可行性结论。
端到端交付
从场景评估到生产上线的完整承包。我们负责架构、开发、集成、测试与灰度,交付物包含源码(或平台配置)、评测集、运维手册与团队培训。
长期陪跑运维
上线之后的部分往往比上线本身更长。按月提供效果复盘、badcase 修复、模型升级评估与成本优化,也可以按人力驻场。
标准交付清单
- 可运行系统与源码或平台配置
- 场景评测集(含标注说明,客户所有)
- 架构设计文档与数据流图
- 接口文档与集成说明
- 部署脚本与运维手册(含故障处置)
- 成本模型与用量预测
- 上线前压测与安全检查报告
- 团队培训与知识交接(录像留档)
我们不承接的情况
以下四类情况我们会建议你另找供应商,或先解决前置问题。
演示型项目
如果目标是一个用于汇报展示、没有日常使用者的界面,我们不适合承接。这类系统在交付之后通常不会被使用。
零错误率的承诺
大模型应用无法做到零错误。我们的做法是把可接受的错误率写进验收标准,并设计出错之后的兜底路径:人工复核、拒答、或降级到规则。
数据尚未就绪时直接开工
如果核心知识仍散落在个人电脑和聊天记录里,第一阶段应该是数据治理而不是模型工作。这部分我们也可以承接。
技术锁定
接口保持 OpenAI 兼容,编排逻辑与模型解耦,评测集与数据归客户所有,私有化部署可完全脱离我们运行。