岗位职责
- 【岗位职责】 职位描述 参与公司AI计算平台后端研发与演进,按方向覆盖以下系统线: 1、推理服务平台:负责在线推理服务的发布/灰度/扩缩容、健康检查、故障自愈与版本回滚;参与推理引擎(vLLM/SGLang/TensorRT-LLM等)集成适配与模型量化部署(FP8/INT8/W8A8),支撑多机器分布式在线推理;基于Kubernetes设计服务编排与弹性调度,提升GPU/NPU利用率与服务SLA。 2、资源与任务调度:负责多租户队列、配额与优先级、拓扑/亲和、弹性策略与成本治理;设计训推混部调度策略,统筹训练与推理任务资源分配;基于Kubernetes开发调度控制器(CRD/Operator),落地批调度(Kueue/Volcano),支持千卡级训练排队与gang调度。 3、平台基础能力:负责统一API网关、权限控制(RBAC)、配额管理与审计日志等底座;建设集群可观测与告警体系(Prometheus/Grafana/Loki/OpenTelemetry);参与训练数据存储与分发系统(数据集版本、冷热分层与缓存、分片并行读取、对象存储/NAS/PFS接入);参与故障自愈、SLO保障与应急响应。 4、设计并实现平台统一API、权限与审计,沉淀"训练/推理/数据"稳定契约,降低算法团队接入成本,提升算法交付与迭代效率;与算法/框架团队协作,支撑千卡级稳定训练与多机器分布式在线推理。 【任职要求】 职位要求 1、本科及以上,计算机/软件/电子/自动化/人工智能等相关专业; 2、熟练掌握Go或Python至少一门语言(同时具备两者经验最佳),具备扎实的编程基础与项目落地经验; 3、熟悉Linux与Docker,了解Kubernetes服务编排、调度器/控制器机制与基本运维; 4、了解大模型训练/推理流程,对推理服务化、模型量化、分布式训练通信有基本认知; 5、具备并行计算、网络与存储的基本工程认知,了解测试/CI/CD/回滚等工程化实践; 6、加分项(任选其一即可):1. 推理引擎(vLLM/SGLang/TensorRT-LLM等)使用或适配;2. k8s control plane/controller开发(CRD/Operator二开)或批调度(Kueue/Volcano/gang调度);3.训推混部/弹性调度/GPU拓扑感知与成本治理;4. 可观测体系(Prometheus/Grafana/Loki/OpenTelemetry等)或对象存储/NAS/PFS与缓存预热;5.API网关/RBAC/审计;6.GPU作业排障(NCCL/FSDP/网络拓扑); 7、对AI Infra与云原生有热情,沟通协作能力好,自驱力强。
DeepCampus 提醒:官网投递前请确认个人信息与简历版本。建议在投递前检查简历最新版本,确保教育经历、实习经历、项目经历等信息完整准确,提升通过率。