Refine Reset All
Sort by
Location
Employer/Recruiter
Date Posted
Location
Job Type
Employer/Recruiter
All Filters

Hip Jobs In China - 7 Job Positions Available

Top Cities:
1 – 7 of 7 jobs
Xiaomi jobs

高性能算子库开发工程师 北京 社招 全职 职位 ID:A202179 职位描述 1. 设计、开发并优化面向NPU的高性能算子库,覆盖卷积、矩阵运算、归一化等核心算子;2.基于类CUDA编程语言或NPU专用指令集,实现算子极致性能优化,降低延迟与功耗;3.深入理解NPU硬件架构(如计算单元、内存层级、数据流),针对硬件特性进行算子级优化;4.与芯片团队紧密协作,反馈算子性能瓶颈并提出硬件改进建议;5.编写高性能计算代码、汇编级优化及Benchmark测试。 职位要求 1.计算机科学、电子工程、数学等相关专业,本科及以上学历;2. 熟悉cuda/C++/Python中至少一种编程语言;3. 具备类CUDA编程经验(CUDA/OpenCL/HIP等)或NPU SDK开发经验;4. 熟悉并行计算体系结构,有NPU/GPU开发和优化经验优先;5. 对性能优化有极致追求,能通过Profiling工具(如Nsight、VTune)定位瓶颈6. 良好的团队沟通能力, 责任心强。 投递...

Premium Full-time
Xiaomi  23 days ago
Xiaomi jobs

高级llvm编译器开发工程师 北京、上海 社招 全职 职位 ID:A128153 职位描述 1. 基于Clang/LLVM框架,设计并实现面向SIMT架构的编程语言编译器;2.开发LLVM IR到SIMT硬件指令(如GPU/NPU并行指令集)的转换与优化;3.扩展Clang前端支持SIMT编程语言特性;4.设计针对SIMT架构的编译器优化策略:5.与硬件团队协同设计编译器-芯片联合优化方案; 职位要求 1. 计算机科学、电子工程相关专业硕士及以上学历;2. 3年以上编译器开发经验,有GPU/NPU编译器开发经验者优先;4. 有SIMT编程语言(CUDA/HIP/OpenCL)编译器或运行时开发经验;5. 精通LLVM编译器框架,具有实际参与Clang/LLVM后端开发或重要Pass开发经验;6. 深入理解SIMT执行模型(线程层次结构、Warp调度、内存层级);7. 熟悉编译原理关键技术:数据流分析、指令选择、寄存器分配、循环优化;8. 掌握现代C++(C++17/20)、Python,具备大规模代码工程化开发能力; 投递...

Premium Full-time
Xiaomi  23 days ago
H&M Group jobs

Company Description ARKET offers essential collections for women, men, children and the home, along with a seasonal vegetarian café and coffee shop. Inspired by simplicity, nature, and the aesthetics of slow living, the assortments features garments,

H&M Group  20 days ago
小米科技 Xiaomi Technology jobs

大模型后训练与GPU/加速器内核优化实习生 北京 校招 实习 算法类 职位描述 面向CUDA及多架构加速器(类CUDA)内核开发的垂直场景,基于现有基础模型开展后训练与评测落地,提升模型在内核生成/改写/性能优化上的实用能力,并在真实业务中落地1. 构建/清洗面向内核的训练数据与指令模板(生成、优化、注释、性能提示等);2. 基于SFT、DPO/奖励建模、PPO/RLHF/RLAIF等开展后训练与对齐;3. 搭建自动化评测闭环:编译-单测-正确性-性能基准与指标(可编译率、通过率、吞吐/延迟、寄存器/共享内存、occupancy等);4. 集成编译/分析/运行工具,将静态/动态性能信号引入训练反馈。 职位要求 1. 硕士/博士在读,大模型方向;2. 至少一种LLM后训练实践(SFT或RLHF/RLAIF/奖励建模/DPO等),重视训练-评测落地能力,有coding方向经验加分;3. 熟悉PyTorch与数据处理,能搭建训练/评测流水线;了解分布式/混合精度者优先;4. 具备CUDA/GPU并行基础,能阅读/编写内核并定位性能瓶颈;熟悉nvcc/clang与profilers等工具;5. 工程能力扎实(Python优先,C/C++加分),自驱与协作良好。加分项1. 有CUDA/HIP/SYCL或其他加速器内核优化经验;搭建过编译-运行-打分闭环;2. 在算子优化/并行计算/系统性能工程方面有积累;有开源、论文或竞赛经历。 投递...

小米科技 Xiaomi Technology  14 days ago
H&M Group jobs

Company Description Job Description Welcome to H&M Logistics Within H&M, our Logistics network ensures a seamless, flexible, and swift distribution process, by delivering products to our stores and online customers, every single day. Working as part

H&M Group  9 days ago
H&M Group jobs

Company Description Job Description Welcome to H&M Logistics Within H&M, our Logistics network ensures a seamless, flexible, and swift distribution process, by delivering products to our stores and online customers, every single day. Working as part

H&M Group  9 days ago
ShengShu jobs

大模型AI Infra工程师(PRC) 北京 全职 互联网 / 电子 / 网游 职位描述 1、核心算子开发与极致优化:基于华为昇腾(Ascend 910B等)、平头哥等国产AI加速芯片,进行深度学习核心计算算子(如Attention、Linear、LayerNorm、MoE等)的高性能定制开发与迭代优化;2、AI框架与系统适配:负责将主流开源AI框架(如PyTorch、MindSpore)及大模型训练/推理工具链(如Megatron-LM、DeepSpeed、vLLM等)深度适配到国产算力平台上,确保功能正确性与系统稳定性;3、端到端性能调优:使用底层性能分析工具(如Ascend Profiler等)进行算子级与模型级的性能瓶颈分析。针对计算、访存、通信瓶颈制定调优策略(如算子融合、混合精度、计算与通信重叠设计);4、编译优化与前瞻探索:参与探索TVM、MLIR、Triton等AI编译器技术在国产异构后端的应用,提升算子自动生成效率与多硬件平台的泛化适配能力。 职位要求 1、基础条件:计算机科学、软件工程、电子工程、数学或相关专业,本科及以上学历,具备扎实的计算机体系结构基础,深入理解GPU/NPU微架构、并行计算原理及内存一致性模型;2、专业技能:编程能力:精通C/C++与Python,具备出色的工程实现与架构设计能力;异构开发经验:熟练掌握至少一种主流并行编程语言(CUDA / HIP / OpenCL / Ascend C),有丰富的底层算子开发、调试和调优经验;AI框架机制:深入理解至少一种深度学习框架(PyTorch/TensorFlow/MindSpore)的底层运行机制(如计算图、算子分发机制、显存池管理等);3、【加分项】(满足其一即可优先考虑):具备华为昇腾CANN开发体系经验,熟练掌握Cube/Vector Core编程模型者优先;有千亿级参数大模型(如LLaMA、Qwen、GLM)在国产算力集群上的训练、微调或推理落地经验者优先;在开源社区(如MindSpore、vLLM、FlashAttention、Cutlass等)有核心代码贡献者优先。 投递...

ShengShu  6 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

hip

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Location
Employer/Recruiter