9月7日,一场名为「Hardware-Aware AI: Building PyTorch Workloads Across Accelerators」的活动在上海国际会议中心举行。本次活动是KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China 2026等多个大型技术峰会同期举办的一部分。
本场活动由华为主办,汇聚了PyTorch Foundation、昇腾以及多个开源项目的技术专家与开发者参与,共同探讨AI基础设施的演进方向。这表明业界对构建跨异构加速器兼容的AI工作负载具有高度关注度。
在具体的分享环节中,Ascend for PyTorch TC Member李晶围绕《TorchNPU:昇腾上的PyTorch框架优化设计与实践》进行了分享。该分享聚焦于框架层面对硬件的适配和优化设计,旨在提升PyTorch在昇腾平台上的原生支持能力。
此外,Triton-Ascend社区Maintainer杨开昕则展示了Triton这一算子开发范式在昇腾NPU上的落地实践。杨开昕以《Triton-Ascend AI编译器的优化策略和实践》为题,详细阐述了如何利用Triton进行AI编译器的优化,从而提升模型在昇腾硬件上的运行效率。
本次活动的技术分享覆盖面极广,现场来自DeepSpeed、vLLM-Omni、FlagTree等多个开源项目的技术专家也进行了分享。这些分享分别从大模型分布式训练、全模态推理以及AI编译等前沿方向,展示了各自最新的工程实践成果。
从时间线和技术演进的角度看,本次活动体现了一个清晰的趋势:即AI工作负载的优化正从单纯的模型层面深入到框架、编译器和底层硬件适配层。这要求软件栈必须具备高度的“硬件感知”(Hardware-Aware)能力。
华为方面明确表示将持续参与PyTorch及全球AI开源生态建设,并致力于完善以TorchNPU、Triton-Ascend为代表的开源软件能力体系。这一持续投入表明了其在推动行业标准和技术栈成熟度方面的长期战略布局。
对于关注AI基础设施演进的开发者而言,本次活动提供了一个重要的参考点:即业界正在构建一个多层次、高度互联的生态系统。从PyTorch这个上层框架开始,向下深入到Triton这样的编译优化工具,再结合昇腾NPU等特定硬件加速器,形成一套完整的、可落地的解决方案。
需要指出的是,本次活动的内容和分享均基于公开资料记录,展示了截至9月7日这一时间节点上,业界在提升PyTorch兼容性和性能优化方面所取得的阶段性成果。这些技术实践构成了当前AI基础设施演进的重要组成部分。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。