AI 监控项目的算力规划,是技术方案里最容易出错、也最容易被供应商故意模糊的部分。买少了,算法卡顿漏检;买多了,几十万预算白花。这篇文章给你一套可以自己算的方法。
一、先算总需求
算力需求的基本单位是"路",不同算法的算力消耗差异很大。以主流的 GPU 服务器为参照,单卡(如主流推理卡)可支持的并发路数大致如下:
- 移动侦测 / 区域入侵:约 128 - 256 路
- 人形检测 / 人员计数:约 64 - 128 路
- 安全帽 / 反光衣识别:约 32 - 64 路
- 烟火识别:约 24 - 48 路
- 人脸检测(不含识别):约 32 - 64 路
- 人脸识别(1:N 比对):约 8 - 16 路(取决于底库规模)
- 行为分析(摔倒、攀爬、徘徊):约 16 - 32 路
把这些数字代入你的实际点位与算法组合,得到基础需求。然后:
- 加上 30% 的冗余:应对后续新增点位与算法升级。
- 乘以 1.2 的安全系数:避免设备长期高负载运行导致性能衰减与死机。
举例:200 路点位,其中 60 路需要人形检测、80 路需要安全帽识别、60 路需要烟火识别。
计算:60/96 + 80/48 + 60/32 ≈ 0.63 + 1.67 + 1.88 = 4.18 卡。
加 30% 冗余 = 5.43 卡,乘 1.2 = 6.5 卡。
结论:配置 7 卡的算力服务器(或等效的多台设备)。
二、边缘计算 vs 中心计算
边缘计算(算法就近部署)
做法是在摄像机附近部署算法盒子或智能摄像机,视频流不出局域网就在本地完成分析。
优势:
- 网络带宽占用极低,只需上传告警事件和结构化数据,不需要传视频流。
- 响应延迟低,通常在 500ms 以内。
- 单点故障影响范围小,一个盒子坏了不影响其他区域。
- 适合网络条件差、布线困难的现场(如偏远点位、临时工地)。
劣势:
- 单点算力有限,通常每盒 4 - 16 路,点位多时需要大量盒子,总体成本可能更高。
- 运维分散,升级、调优、排障都需要到现场或远程逐台操作。
- 算力难以灵活调配,某个盒子跑不满、另一个盒子不够用的情况很常见。
中心计算(统一汇聚分析)
做法是把所有视频流汇聚到机房,由集中部署的 GPU 服务器统一分析。
优势:
- 算力集中,可以灵活调配,利用率高。
- 运维简单,升级调优在一台设备上完成。
- 扩容方便,加卡或加服务器即可。
- 适合算法种类多、需要频繁调优的场景。
劣势:
- 对网络带宽要求高。200 路 200 万像素视频流(每路 2.5 Mbps)需要约 500 Mbps 的持续带宽。
- 机房需要具备散热、供电、承重条件。一台 4 卡 GPU 服务器功耗可能超过 1,500W。
- 单点故障影响范围大,需要做冗余。
三、混合架构:大型项目的最优解
实际上,规模稍大的项目几乎都采用混合架构。划分原则很简单:
- 用中心计算的:核心厂区、机房网络条件好、点位集中、算法种类多的区域。
- 用边缘计算的:远端独立站点、网络带宽受限、布线困难、只有单一算法的区域。
我们做过的某个 1,860 路项目就是这样划分的:主厂区 1,400 路用中心计算(4 台 GPU 服务器),3 个远端分厂共 460 路用边缘盒子(每个分厂 2 - 3 台),边缘盒子只回传告警事件与结构化数据,中心平台统一管理。
四、四个容易被忽略的算力陷阱
陷阱一:只算推理算力,忘了视频解码
GPU 服务器除了跑算法,还要承担视频解码任务。200 路 1080p 的解码本身就是不小的负载。规划时必须把解码算力单独核算,否则会出现在算法还没跑满时 GPU 就已经吃紧的情况。
陷阱二:忽略算法更新带来的算力增长
算法的复杂度是在持续上升的。去年能带 128 路的卡,今年升级到新版本算法可能只能带 96 路。所以冗余一定要留足,建议 30% 起步。
陷阱三:不考虑机房环境承载
GPU 服务器的功耗和发热远超普通服务器。必须确认机房空调制冷能力、UPS 容量、机柜承重是否匹配。我们见过机房因 GPU 服务器过热降频,导致算法性能腰斩的案例。
陷阱四:低估调优所需的时间
算力规划不是买完设备就结束了。实际部署后需要做压力测试、负载均衡配置、算法参数调优,这个过程通常需要 3 - 7 天。方案里应该包含这部分工作量和时间。
五、成本参考
- 边缘算法盒子:支持 8 路左右的约 3,000 - 8,000 元/台;支持 16 路的约 8,000 - 20,000 元/台。
- 边缘智能摄像机:内置算法,约 1,500 - 4,000 元/台(算力有限,通常只支持 1 - 2 种轻量算法)。
- 中心 GPU 服务器:4 卡配置约 8 - 20 万元;8 卡配置约 20 - 45 万元(取决于 GPU 型号)。
- 算法授权:按路按年计费,约 200 - 800 元/路/年,具体取决于算法复杂度。
六、给方案的检查清单
拿到一份 AI 监控方案时,用这五条检查它的算力部分是否靠谱:
- 方案里有没有明确的算法清单与对应路数?
- 算力测算过程是否写清楚了(而不是只给一个结论)?
- 冗余比例是多少?有没有考虑解码与算法升级?
- 本地机房条件(电力、制冷、空间)是否核算过?
- 是否包含压力测试与负载均衡配置的工作量?
如果一份方案的算力部分只有"配置高性能 AI 服务器一台"这样的一句话,那基本可以判断供应商没认真做过测算。