🧠 DaNiu-AI 自研推理池:闲置算力转化为私有 LLM 推理节点

admin 2026-07-21 3,242 阅读 收藏

自研推理池架构理念

DaNiu-AI 自研推理池是项目核心基础设施之一。核心理念是将舰队中闲置的高配服务器(32核 / 123G)转化为私有 LLM 推理节点,通过 Ollama 推理引擎 + New API 网关的统一接入层,构建自主可控的私有推理能力池。

自研推理池架构
自研推理池架构:闲置算力 → 统一推理服务

三层架构

推理层:Ollama 引擎

每台运营机部署 Ollama,加载推理模型(如 Qwen3:8b、Qwen3:32b)。Ollama 提供高效的本地推理能力,支持 GPU 卸载和量化部署,最大化利用服务器算力。

网关层:New API 聚合

所有 Ollama 节点注册到 New API 网关(运营 2 : 3005),作为标准 channel 统一管理。客户端通过单一 endpoint 即可访问所有推理节点,无需关心底层分布。

调度层:智能路由

网关根据各节点的负载状态和模型能力自动调度请求。支持优先级路由、故障转移和模型版本管理,确保推理服务高可用。

核心优势

  • 零额外成本:利用已有机器的闲置算力,无需 GPU 投资
  • 数据私有化:敏感数据不出企业内网,满足合规要求
  • 弹性扩展:新机器加入舰队即自动成为推理节点
  • 统一管理:通过 New API 面板监控所有节点的运行状态

已部署节点

节点部署模型资源规格
运营 2Qwen3:8b(主)/ Qwen3:32b(备用)32核 123G
运营 7规划中AMD EPYC 9K65 16C/32T
运营 9规划中AMD EPYC 9K84 16C/32T
运营 11规划中Xeon 6983P-C 16C/32T

快速接入自有节点

如果想将自己的服务器加入 DaNiu-AI 推理池,只需三步:安装 Ollama → 拉取模型 → 注册到网关。详情参考聚合网关客户使用手册(ID: 352)。