岗位职责
- 【职位描述】 我们正在寻找一位具有系统工程深度与性能优化能力的机器学习高级工程师,共同构建面向量化研究的投研平台。该平台服务于大规模分布式计算、机器学习训练与推理任务,涵盖从云原生资源调度、任务编排,到模型加速与生命周期管理的全链路基础设施。 你将参与平台架构设计、核心模块开发和性能调优,提升系统的稳定性、可扩展性与运行效率。通过持续探索软硬件协同优化、调度算法、模型性能瓶颈分析等方向,帮助团队实现低延迟、高吞吐、强可观察性的计算基础能力。 【岗位职责】 设计与开发支持量化研究与机器学习任务的高性能分布式平台,提升整体系统的可用性与扩展性; 优化模型训练与推理的执行效率,包括资源调度、异构计算、存储IO与通信路径; 深度参与Kubernetes集群的调度策略、任务管理与服务稳定性改进; 分析性能瓶颈,持续优化包括CPU/GPU利用率、内存/缓存命中率、模型加载效率等核心指标; 跟踪并落地业界前沿计算架构和系统优化方案,不断提升平台技术栈先进性。 【任职要求】 重点本科及以上学历,计算机、电子工程、数学或相关专业; 熟练掌握计算机体系结构,了解现代 CPU/GPU 微架构与性能调优方法; 熟悉 Kubernetes 生态,具备基于 K8S 的分布式系统开发或调度经验; 熟悉 Linux 环境,具备多线程/多进程编程经验,能使用系统级性能分析工具(如 perf、nsys、nvprof 等); 理解主流深度学习框架(如 PyTorch、TensorFlow)底层机制,具备模型执行优化经验; 熟练掌握常用数据结构与算法,具备良好的系统设计能力和工程实现能力。 【加分项】 参与 TVM/XLA等深度学习编译器开发; 熟悉分布式存储、高性能通信协议(如 InfiniBand、RDMA); 有大规模模型训练/推理服务部署与优化经验; 在开源高性能计算/AI系统中有贡献; 拥有 ACM 区域赛金牌及以上或类似竞赛背景。
DeepCampus 提醒:官网投递前请确认个人信息与简历版本。建议在投递前检查简历最新版本,确保教育经历、实习经历、项目经历等信息完整准确,提升通过率。