自研推理池架构理念
DaNiu-AI 自研推理池是项目核心基础设施之一。核心理念是将舰队中闲置的高配服务器(32核 / 123G)转化为私有 LLM 推理节点,通过 Ollama 推理引擎 + New API 网关的统一接入层,构建自主可控的私有推理能力池。

三层架构
推理层:Ollama 引擎
每台运营机部署 Ollama,加载推理模型(如 Qwen3:8b、Qwen3:32b)。Ollama 提供高效的本地推理能力,支持 GPU 卸载和量化部署,最大化利用服务器算力。
网关层:New API 聚合
所有 Ollama 节点注册到 New API 网关(运营 2 : 3005),作为标准 channel 统一管理。客户端通过单一 endpoint 即可访问所有推理节点,无需关心底层分布。
调度层:智能路由
网关根据各节点的负载状态和模型能力自动调度请求。支持优先级路由、故障转移和模型版本管理,确保推理服务高可用。
核心优势
- 零额外成本:利用已有机器的闲置算力,无需 GPU 投资
- 数据私有化:敏感数据不出企业内网,满足合规要求
- 弹性扩展:新机器加入舰队即自动成为推理节点
- 统一管理:通过 New API 面板监控所有节点的运行状态
已部署节点
| 节点 | 部署模型 | 资源规格 |
|---|---|---|
| 运营 2 | Qwen3:8b(主)/ Qwen3:32b(备用) | 32核 123G |
| 运营 7 | 规划中 | AMD EPYC 9K65 16C/32T |
| 运营 9 | 规划中 | AMD EPYC 9K84 16C/32T |
| 运营 11 | 规划中 | Xeon 6983P-C 16C/32T |
快速接入自有节点
如果想将自己的服务器加入 DaNiu-AI 推理池,只需三步:安装 Ollama → 拉取模型 → 注册到网关。详情参考聚合网关客户使用手册(ID: 352)。