并行集团 官方来源

智算中心运维主管(J10249)

2027届秋招 湖北省-宜昌市 本科
招聘人数:若干截止时间:

岗位职责

  • 【岗位职责】 1. 负责智算中心现场运维管理工作,统筹服务器、GPU 设备、网络设备、存储设备、线缆、光模块、备件及现场工具耗材的日常维护和管理。 2. 负责现场物理操作组织与执行,包括设备上架、下架、搬运、理线、标签粘贴、线缆连接、端口核对、设备加电断电、硬件更换、故障设备拆装等工作。 3. 负责资源交付现场实施保障,根据交付计划组织现场人员完成设备安装、机柜部署、布线连接、基础连通性检查、交付验收配合等工作,保障资源按期交付。 4. 负责服务器、网络、存储等硬件设备的现场维护,包括硬盘、内存、电源、风扇、网卡、光模块、线缆、GPU 等部件的检查、更换、记录和反馈。 5. 负责现场日常巡检工作,检查机柜、服务器状态灯、设备运行状态、端口连接、线缆规范、环境卫生、电力安全、机房秩序等,及时发现并处理异常。 6. 负责现场库房和备件管理,管理整机、零部件、线缆、光模块、硬盘、电源、工具耗材等物资,确保入库、出库、借用、归还、报废、盘点等流程清晰准确。 7. 负责资产台账维护与盘点,确保设备 SN、资产编号、所在机柜、U 位、配置、使用状态、责任归属、维修记录、出入库记录等信息准确、完整、及时更新。 8. 负责故障处理和工单闭环,组织现场人员按照工单要求完成硬件检查、故障确认、换件操作、拍照记录、信息反馈、结果确认等工作,并推动问题闭环。 9. 兼顾基础系统层运维工作,包括服务器操作系统基础检查、Linux 常用命令操作、基础网络连通性测试、日志收集、监控告警初步确认、故障信息整理等。 10. 配合系统、网络、平台团队处理现场问题,在需要时协助完成设备登录、日志导出、网口状态检查、磁盘状态检查、GPU 状态检查、BMC/IPMI 信息核对等基础操作。 11. 负责现场操作规范建设,制定和执行上架、下架、换件、理线、标签、资产登记、库房管理、巡检、安全操作、工单处理等标准流程。 12. 负责现场团队管理和排班协调,安排现场工程师 58 小时在岗及 724 小时应急响应,明确分工,监督执行质量,提升现场响应效率。 13. 负责现场安全和秩序管理,关注用电安全、搬运安全、设备操作安全、机房出入管理、工具使用、消防通道、现场卫生等,降低人为操作风险。 14. 负责与客户、数据中心、厂商及内部团队协同,配合完成设备交付、故障处理、备件更换、资产核对、现场验收、报修及 RMA 等工作。 15. 推动现场运维工作的标准化和工具化,逐步提升资产管理、库房管理、巡检、工单、换件记录、系统检查等工作的规范性和可追溯性。 【任职要求】 1. 具备 3 年以上数据中心、IDC、服务器、网络设备、智算中心或硬件交付运维经验,其中 1 年以上现场团队管理经验优先。 2. 熟悉数据中心现场运维工作,能够独立组织设备上架、下架、理线、标签、硬件更换、设备巡检、故障处理等现场操作。 3. 熟悉服务器硬件结构,了解 CPU、内存、硬盘、网卡、电源、风扇、GPU、RAID 卡等常见部件,具备基础故障判断和更换能力。 4. 了解网络设备和布线基础知识,能够识别交换机端口、光模块、网线、光纤、MPO/LC 等常见线缆和连接方式,能够配合完成网络连线、端口核对和连通性检查。 5. 具备良好的资产管理意识,能够维护设备台账,准确记录设备 SN、资产编号、配置、位置、状态、出入库、维修和报废信息。 6. 熟悉或愿意承担现场库房管理工作,能够管理整机、备件、耗材、工具等物资,保证账实一致、出入库清晰、盘点准确。 7. 具备基础 Linux 操作能力,掌握常用命令,能够完成系统登录、状态检查、日志查看、网络连通性测试、磁盘状态查看、进程和服务状态查看等基础操作。 8. 了解服务器带外管理相关工具或能力,如 BMC、IPMI、Redfish、远程控制台、设备重启、硬件告警查看等。 9. 了解 GPU 服务器基础运维者优先,包括 GPU 状态检查、驱动状态确认、基础故障现象识别、配合平台团队收集 GPU 相关信息等。 10. 具备较强的现场执行力和组织协调能力,能够根据交付计划、故障工单和现场实际情况安排人员完成任务。 11. 责任心强,工作细致,能接受数据中心现场工作环境,能够适应搬运、上架、布线、换件、巡检、应急处理等现场工作。 12. 具备较强的安全意识,熟悉或愿意遵守数据中心电力安全、搬运安全、设备操作安全、机房出入和消防安全要求。 13. 具备良好的沟通能力和客户服务意识,能够清晰反馈现场进展、问题风险和处理结果。 加分项 1. 有智算中心、GPU 服务器、大规模服务器集群现场运维经验。 2. 有 GPU 服务器、HGX、DGX、NVIDIA 相关硬件设备换件或交付经验。 3. 有 IDC 机房批量上架、批量布线、资产盘点、库房管理经验。 4. 熟悉服务器厂商报修流程、备件更换流程、RMA 流程。 5. 使用过资产管理系统、工单系统、库房管理系统、CMDB、监控系统等工具。 6. 掌握 Shell、Python、Ansible 等基础自动化工具,能够编写简单巡检、信息采集或批量操作脚本。 7. 有带领一线运维团队、外包团队或现场交付团队经验。

DeepCampus 提醒:官网投递前请确认个人信息与简历版本。建议在投递前检查简历最新版本,确保教育经历、实习经历、项目经历等信息完整准确,提升通过率。