主题: 高级 AI 数据中心网络工程师 | xiaolu.hu@easy2mine.io | 8/20/2026
薪水: 面议
地点: 纽约州境内 纽约州, NY
分类: 软件程序
日期: 8/20/2026
岗位描述:
-
工作地点:base 乔治亚,根据项目情况全美范围内出差
-
负责 AI 数据中心及 HPC 环境网络的日常运维、监控、故障处理,保障 GPU 集群稳定高效运行
-
负责 InfiniBand(IB)、RoCE v2 高性能网络架构设计、拓扑规划、组网方案深化及实施交付
-
制定网络架构方案、部署标准、交付规范及运维流程,确保高可用、高扩展、高性能及安全稳定
-
管理 Cisco、Arista、Juniper、NVIDIA Networking(Mellanox)等网络设备的安装、配置、升级、扩容及生命周期维护
-
部署和运维 AI 训练集群网络环境,支持 IB、RoCE v2、RDMA 及高速 Ethernet Fabric 网络
-
精细化定位与解决网络中断、丢包、高延迟、链路异常、Fabric 异常等故障
-
负责 AI 集群网络性能测试与优化,涵盖 IB/RoCE 连通性验证、带宽与时延压测、NCCL 通信性能测试及 GPU 集群通信优化
-
负责网络拥塞控制与调优,包括 PFC、ECN、Lossless Ethernet 设计优化,实现低延迟高吞吐
-
使用 Python、Bash、Ansible 实现自动化配置、巡检、备份及故障分析
-
编写维护网络拓扑图、IP 规划、配置文档、故障报告等;参与重大故障应急响应
-
核心要求:具备 AI 集群网络实际部署运维经验,熟练掌握 IB、RoCE v2、RDMA、NCCL;能独立完成架构设计、部署、压测及调优;精通 PFC、ECN、无损以太网及拥塞控制;熟悉 NVIDIA AI 网络解决方案
-
基础要求:本科及以上学历(计算机/网络/通信等相关专业优先),4 年以上数据中心网络经验;熟悉 Spine-Leaf、VXLAN EVPN 等架构;精通 TCP/IP、BGP、OSPF 等协议;熟悉 Cisco/Arista/Juniper/Mellanox 设备;了解 100G-800G 高速链路
-
系统与自动化:熟悉 Linux 网络配置;具备 Python/Bash/Ansible 自动化能力;了解 Prometheus/Grafana/Zabbix 等监控工具
-
具备良好故障分析与文档撰写能力;英文良好,能阅读技术文档并进行基本交流
-
接受美国境内长期出差
-
优先:有 NVIDIA DGX/SuperPOD/AI Factory/HPC 集群经验、大型 GPU 集群交付经验、公有云网络经验、Kubernetes 网络经验
-
应聘请加招聘 HR Cathy 微信:cathy2025sh,简历发送至 xiaolu.hu@easy2mine.io
—— 联系时请说是在华人招聘网上看到的,谢谢!