视频号
    标题 摘要 内容
    详情
    在多机多卡的大模型推理服务中,GPU 之间需要频繁交换数据,通信效率直接关系到请求延迟和服务吞吐。当服务出现波动时,问题可能来自 GPU、网络,也可能与进程状态或通信执行有关,排查往往需要在多台节点、多种工具和日志之间反复核对。

    围绕这一问题,优刻得与上海科技大学联合推进 cloud-probe 的研发,将基础设施监控与 NCCL GPU 通信内核级观测相结合,为大模型推理服务提供更细致的通信性能分析与异常排查能力。

    通过插件接入、节点采集和多源数据关联,cloud-probe 将服务指标、通信操作、GPU 状态和网络信息汇集到同一视图,为推理集群的运行维护和性能优化提供依据。


    图片
    cloud-probe 通信总览与运行时带宽监控
    从资源状态深入通信执行
    GPU 利用率、显存占用和网卡流量,是了解推理服务运行状态的重要指标。但要进一步分析一次通信为什么变慢,还需要知道:执行了什么操作、传输了多少数据、哪些 GPU 参与,以及各个参与进程的耗时是否一致。
    NCCL 承担着多 GPU 之间的集合通信。分析通信问题,需要深入其执行过程,将资源状态与具体通信操作对应起来。
    核心能力
    cloud-probe 提供三项关键能力:
    - 业务代码无侵入的 NCCL 内核级观测:通过插件获取真实推理运行中的通信操作、执行耗时与带宽,无需修改业务代码,减少业务侧埋点和改造工作。
    - 面向真实负载的通信性能分析:按消息大小和 Rank 分别统计带宽与时延,小消息重点关注时延,大消息重点关注带宽,并通过分位统计发现平均值之外的性能波动。
    - 多源关联的异常诊断:结合服务、进程、GPU 和网络信息,将告警关联到具体节点及通信参与对象,梳理影响范围并提供检查建议,帮助运维人员缩小排查范围。
    业务代码无侵入,建立统一观测链路
    推理服务通常包含多个工作进程,并分布在不同节点上。逐个修改业务代码、增加埋点,会增加接入和维护工作,也不便于随着服务扩容统一管理。
    cloud-probe 采用插件与节点 Agent 配合的方式。完成兼容的 NCCL 运行库、插件和采集组件配置后,无需修改业务代码,即可采集经过 NCCL 的通信操作。
    通信插件获取操作信息,节点 Agent 分别采集 GPU、进程、网络接口和 NCCL 健康状态,再上报到统一的汇聚端。服务指标与拓扑数据通过相应接口或采集文件接入,按照任务、节点、进程和通信域进行关联。
    图片
    cloud-probe 整体架构
    按消息大小,看清真实推理通信表现
    真实推理服务中的通信消息大小并不固定。即使是同一种通信操作,不同大小的消息也会呈现出不同的带宽和时延。将这些操作混在一起统计,一个整体平均带宽数值很难反映各类消息的实际表现。
    小消息重点看时延,大消息重点看带宽。对于小消息,需要关注完成一次通信所需的时间及其波动;对于大消息,则更关注数据传输效率。区分消息大小,有助于选择合适的指标分析通信表现。
    cloud-probe 直接采集推理引擎运行中的 NCCL 操作,按消息大小(Payload)分桶,分别展示通信带宽与时延。在同一统计时间范围内,还可以比较各个 Rank 的典型表现和慢侧分位,观察不同大小消息的性能差异,以及平均值可能掩盖的波动。
    图片


    横轴为消息大小区间,不同颜色对应不同 Rank

    带宽图中的 P90/P99 表示慢侧分位,对应带宽的 P10/P1;时延图取 P90/P99 高尾

    GPU 计时数据可结合 Nsight Systems 交叉核对,通信表现也可在匹配条件下与 nccl-tests 基准结果对照。
    从异常告警到具体排查对象
    cloud-probe 可关联服务、进程、通信和硬件层面的异常信息,将告警对应到具体节点、Rank、进程和 GPU,并梳理受影响的通信域,帮助运维人员缩小排查范围。
    系统根据部署环境提供相应的检查建议和操作入口,支持进一步核查 RAS 连通性、GPU 状态及 NCCL 操作停滞等问题,减少在多台节点、多种工具之间反复核对的工作。
    图片
    cloud-probe 异常诊断——问题定位、影响范围与排查建议
    从可观测走向自动化运维
    此次合作将云基础设施的工程实践与高校的系统研究相结合,未来,双方将继续围绕实际推理负载验证和完善 cloud-probe,推动通信观测能力在云上推理场景中的应用;并且还将结合 AI 辅助分析,探索运行巡检和通信瓶颈定位的自动化,减少人工排查工作,为大模型服务的稳定运行与性能优化提供支撑。
    不仅如此,优刻得孔明平台将集成cloud-probe,为云上大模型推理服务提供通信性能分析与异常诊断能力,并为后续自动化巡检与辅助分析提供支撑。(孔明智算平台是优刻得自主研发的面向AI开发、训练与推理的一站式企业级智算平台,点击链接了解孔明平台)