AI服务器建设进展汇报

信息部 · 2026年7月
服务器:H3C R5300 G6 / 4×NVIDIA L20 48GB
内网地址:192.168.0.27
GPU总算力
192GB显存
已部署模型
3
最大上下文
262K tokens
服务在线率
7×24小时
01

已完成工作

全部完成
硬件采购与到货验收
2026年6月 — 7月上旬
完成 H3C UniServer R5300 G6 服务器采购(合同金额 ¥393,660),配置 2×Intel Xeon Gold 6530(64核)、512GB DDR5内存、4×NVIDIA L20 48GB GPU、2×960GB SATA SSD + 4×3.84TB NVMe SSD。完成外观检查、配置核对、上架加电、BIOS设置等全部验收流程。
操作系统与基础环境部署
7月中旬
安装 Ubuntu 24.04 LTS Server,配置静态IP(192.168.0.27)、DNS、NTP。4块NVMe组RAID5(可用10.5TB)挂载至 /data,系统盘LVM扩容至877GB。时区修正为 Asia/Shanghai。配置防火墙策略,开放API端口。
GPU驱动与CUDA工具链安装
7月中旬
安装 NVIDIA Driver 580(server版)、CUDA Toolkit 12.0、Docker CE 及 NVIDIA Container Toolkit。4张L20全部识别正常,Docker容器内GPU透传验证通过。
大语言模型部署(Qwen3.6-27B)
7月中旬
基于 vLLM 框架部署 Qwen3.6-27B 大模型,4卡张量并行(TP=4),最大上下文262K tokens,显存利用率95%。容器配置 --restart always 实现开机自启。支持 OpenAI API 兼容接口及 Function Calling 工具调用。
Embedding与Reranker模型部署
7月下旬
采用 HuggingFace TEI 框架部署 bge-m3(文本向量化,1024维)和 bge-reranker-v2-m3(重排序)两个模型,分别占用GPU 3约1.5GB显存。冷启动秒级,性能远优于vLLM方案。
压力测试与性能验证
7月中旬—下旬
完成 GPU 满载测试(gpu-burn 30分钟,4卡并行,无降频无报错)、AI推理并发压测(50并发无OOM)。
客户端接入与文档归档
7月下旬
完成 ChatBox、Cherry Studio、Trae Solo CN 等客户端接入配置。编写完整部署运维文档(服务器环境搭建笔记、TEI-BGE部署运维文档、到货验收工具包、任务清单),全部归档。
整机备份计划
7月下旬
通过 NAS 完成整机备份计划,确保服务器系统镜像与数据安全,保障故障场景下的快速恢复能力。
02

当前AI服务器已具备功能

运行中

大模型推理服务

端口 8000 运行中
Qwen3.6-27B 大语言模型,4卡张量并行加速,支持262K超长上下文。兼容 OpenAI API 标准,支持 Function Calling 工具调用。
262K上下文 TP=4并行 Function Calling OpenAI兼容

文本向量化服务

端口 8001 运行中
bge-m3 模型,输出1024维向量,支持100+语言。用于知识库文档索引、语义搜索、相似度计算等场景。
1024维 100+语言 8192序列长度 TEI框架

重排序服务

端口 8002 运行中
bge-reranker-v2-m3 模型,对检索结果进行二次精排,显著提升知识库问答准确率。输出0-1相关性分数。
Cross-Encoder 精度排序 TEI框架
应用层
ChatBox / Cherry Studio桌面客户端
API 调用程序接入
服务层
Qwen3.6-27B:8000 · vLLM · GPU 0-3
bge-m3:8001 · TEI · GPU 3
bge-reranker:8002 · TEI · GPU 3
硬件层
H3C R5300 G664核 / 512GB / RAID5 10.5TB
4×NVIDIA L2048GB × 4 = 192GB
03

接下来的计划

规划中
1
向同事发布大模型接口 高优先级
将 Qwen3.6-27B 大模型 API 接口面向公司各部门同事开放使用。同事可通过 ChatBox、Cherry Studio 等客户端接入,或通过 OpenAI 兼容 API 直接调用,用于日常办公辅助、文案撰写、代码补全、翻译等场景。制定接口使用规范与配额管理策略,确保资源公平分配。
预计时间:近期启动 负责:信息部 受益范围:全公司
2
Dify平台部署与知识库搭建 — 人事部门试点 高优先级
部署 Dify RAG 平台,完成与 vLLM 大模型、TEI Embedding 和 Reranker 的全链路对接。随后以人事部门作为知识库应用的第一个试点,将公司规章制度、员工手册、考勤政策、福利方案、招聘流程等文档导入知识库。人事同事可通过自然语言提问,AI 自动检索相关内容并生成准确回答,减少重复性咨询工作量。试点成功后逐步推广至行政、财务、法务等部门。
预计时间:8月启动 负责:信息部 + 人事部 受益范围:人事部 → 全公司
3
多模型扩展与能力升级 中优先级
根据使用反馈,逐步引入更多模型:多模态模型(支持图片理解)、代码专用模型(提升开发效率)、轻量级模型(降低延迟、提高并发)。探索模型微调与私有化训练能力,针对公司业务场景定制优化。
预计时间:Q3-Q4 负责:信息部 受益范围:按需