AI 院-MOE 训练/推理Infra工程师 北京 全职 互联网 / 电子 / 网游 职位描述 我们正在寻找一位经验丰富的 MOE 训练/推理 Infra 开发工程师,负责设计、实现并优化我们的 MOE(Mixture of Experts)训练和推理框架。该职位需要您具备扎实的分布式系统、高性能计算、深度学习框架以及硬件加速优化的相关知识,能够解决 MOE 训练和推理过程中的各种技术难题,并与算法团队紧密合作,确保算法的顺利实现。主要职责:1、设计并实现高效的 MOE 训练/推理框架:•设计并开发支持大规模分布式训练和推理的 MOE 框架,确保其在各种硬件配置下的高效运行;•优化训练和推理性能,通过算法优化、并行计算、缓存策略等方式,缩短训练和推理时间,提高效率;2、解决 MOE 训练/推理过程中的技术难题:•针对专家网络的选择问题,研究和实现有效的专家选择算法,确保模型在训练和推理过程中的稳定性和准确性;• 解决负载均衡问题,通过动态调整专家网络的负载分配,提高系统资源的利用率,避免过载或空闲状态;• 优化通信过程,减少分布式训练和推理中的通信开销,提高数据传输效率,缩短训练和推理时间3、与算法团队密切合作:•与算法团队保持密切沟通,了解算法需求,根据需求调整和优化训练和推理基础设施,确保算法的顺利实现;•跟踪业界最新技术动态,引入适合项目需求的新技术、新方法,提升团队整体技术水平; 职位要求 关键技能:分布式训练技术:•掌握分布式训练框架(如 Horovod、PyTorch Distributed)的使用和优化。•具备设计和实现高效分布式训练系统的能力。硬件加速优化:•熟悉 GPU、TPU 等硬件架构,能够进行硬件级性能调优。•了解 CUDA、cuDNN 等相关技术,能够利用硬件加速提升训练和推理效率。模型优化技术:•了解量化、剪枝、压缩等模型优化方法,以提升推理效率•能够在实际项目中应用这些技术,优化模型大小和推理速度•负载均衡与通信优化•能够设计高效的负载均衡策略和通信机制,以应对 MOE 模型的稀疏性挑战•优化分布式系统中的通信开销,提高数据传输效率。系统设计能力:•具备分布式系统设计经验,能够解决大规模模型训练和推理中的工程问题。•能够设计和实现高可用、高扩展性的系统架构。其他:•计算机科学、软件工程、人工智能或相关领域的本科及以上学历•熟悉至少一种深度学习框架,如 TensorFlow、PyTorch 等•具备扎实的分布式系统和高性能计算的相关知识,熟悉 MPI、NCCL 等通信库•熟悉 Linux
具身智能-运动智能体 深圳、上海 社招 全职 智能制造 / 工业互联网 / 工业自动化 - 研发 职位描述 【具身端到端规划算法工程师/资深/专家/TL】(深圳/上海/北京)岗位职责:1. 负责研发基于深度学习的四足/人形等机器人的全身状态规划控制,实现灵活自然的动态环境的避障和通过2. 设计实现鲁棒高效的 感知-规划-控制 端到端方案,实现鲁棒高效精准的机器人动作规划3. 设计构建模型训练数据集和标注方法,支持大批量自动化的标注构建4. 应用模仿学习,在/离线强化学习进行模型训练提升模型性能,开发高效的模型评测方法提高迭代效率5. 解决模型评测/部署/真机测试中遇到的问题,满足项目交付指标要求6. 跟踪前沿技术方案,持续迭代升级方案 岗位要求:满足3条及以上1. 人工智能、计算机、机器人、自动驾驶、控制等相关专业硕士或博士学位2. 熟练掌握主流深度学习的时序规划方法如transformer,生成式方法 diffusion policy,掌握主流端到端架构方案如BEV-tranformer/diffusion架构。3. 熟悉基于采样/搜索/优化的决策规划算法,熟悉机器人全身控制。4. 具有模仿学习或强化学习训练经验,熟悉PPO/GRPO/DPO等5. 有实际的端到端系统开发经验,如智能驾驶的E2E。6. 熟练使用PyTorch/TensorFlow深度学习框架,熟练使用Python/C++语言编程,有实际项目开发经验7. 熟悉机器人常用开发环境Mojuco/NVIDIA Isaac/gazebo,有 ROS2/DDS下的开发经验,,能够在Linux环境下独立进行开发和调试; 加分项:8. 有智能驾驶/机器人领域的工程落地经验者优先9. 在机器人顶会(SR/IJRR/TRO/RSS/ICRA/IROS等)或AI顶会(CVPR/NeurIPS/ICML/ICLR等)发表论文者优先
优才-具身大模型训练框架工程师-觅蜂子公司 上海 正式 职位描述 可以选择以下一个或多个方向深入参与:建设具身智能统一训练框架,支撑 VLA、世界模型、分层决策模型等具身基础模型的预训练与后训练,覆盖从十亿级到百亿 / 千亿级参数规模,并面向 300B+ 模型持续演进。建设大规模分布式训练系统,包括数据并行、张量并行、流水线并行、混合并行、MoE、长上下文、低精度训练与推理等,支撑万卡 GPU 集群上的稳定训练。建设规模化后训练与强化学习系统,涵盖模仿学习、在线 / 离线 RL、真机 RL,以及云端训练 + 边缘异步 rollout 的云边协同架构。建设训练效率优化体系,围绕数据、计算、异步、通信全链路进行度量与优化,包括 IO、算子融合、CUDA Graph、计算通信 overlap、梯度同步、性能 profiling 等。与算法团队协作,快速复现并工程化落地 VLA、世界模型、flow matching、RL 等前沿算法。 职位要求 计算机基础扎实,学习能力强,愿意深入复杂系统和底层细节。代码能力强,代码品味好,能熟练使用 AI Coding / Code Agent 提升研发效率。具备良好的系统设计能力,能在功能、效率、稳定性之间做合理取舍。熟悉 Python
算子工程师 北京 社招 全职 技术 - 开发 职位 ID:A103594 职位描述 1、面向GPU/昇腾架构开展算子性能画像、热点定位与优化,持续提升吞吐与时延稳定性。2、结合训练与推理场景,协同框架与编译链路进行内核调优、算子融合、内存访问与并行策略优化。3、建设性能基线与度量方法,沉淀可复用的优化范式与最佳实践,推动持续优化闭环。 职位要求 1、理解计算图、并行化、向量化、内存层次与缓存友好性等关键要点;2、针对目标硬件做深度调优:Occupancy、Memory Coalescing、Shared Memory等;3、建立算子性能基线(Baseline)与回归体系,持续追踪吞吐、延迟、显存占用;4、能独立完成性能分析、问题定位与优化落地,结果导向,热情好学,善于沟通协作与知识沉淀;5、熟悉主流的性能分析工具,熟悉性能优化基本流程和步骤;6、有较强的学习能力。加分项:1、在两种及以上平台完成过端到端算子优化经验;2、有 Attention、GEMM、MoE 等核心算子的手搓或深度优化经验。 投递...
WBG Pioneer - Research & Knowledge Management InternJob #:req37536Organization:World BankGrade:T4 (No-fee)Location:Beijing,ChinaHiring Manager:Cristian Aedo Required Language(s):EnglishPreferred Language(s):Mandarin Chinese (written and spoken)Closing Date:8/12/2026 (11:59pm UTC) Description WBG Pioneers, the World Bank Group’s Internship Program, offers undergraduate and postgraduate
足式机器人运动控制算法工程师(强化学习) 北京 社招 全职 职位 ID:A200582 职位描述 1. 开发基于强化/模仿学习的机器人行走及全身控制策略; 2. 开发复杂地形下基于视觉的强化学习行走策略;3. 负责算法策略的训练与移植部署,实现算法sim-to-real在机器人实机上落地应用; 4. 持续跟踪国内外前沿研究成果,并进行相关算法复现;5. 编写相关技术文档,推动团队技术沉淀与知识共享。 职位要求 1. 硕士及以上学历,机器人、计算机、机械工程、人工智能、应用数学等专业,数学、英语能力扎实,具有较强的学习与研究能力;2. 掌握主流的强化学习算法,如:PPO、DQN、DDPG、SAC等;3. 掌握机器人学习中的广泛使用的训练方法和模型架构,如:教师学生模型(Teacher-Student Network),课程学习(Curriculum Learning),域随机化(Domain Randomization),混合专家模型(MoE)等; 4. 熟悉Mujoco、IsaacGym、IsaacLab等机器人仿真平台;5. 具备足式机器人强化学习算法的实机调试和sim-to-real经验,有基于模型/优化等传统控制经验者优先; 6. 扎实的C++、Python编程能力,熟悉Pytorch等机器学习框架,熟悉Linux,Git,ROS等开发环境和工具。 投递...
自动驾驶-算法优化工程师 北京 社招 全职 职位 ID:A140709 职位描述 1、承担自动驾驶算法的有损优化研发,运用算法-硬件协同设计、网络结构深度优化、训练流程加速、模型量化压缩、MTP投机采样等先进通用技术,为业务团队精心打造并提供高效的训练部署最优方案与实践经验,助力业务高效推进。 2、专注于模型轻量化结构的创新设计与性能雕琢,研发在效果、模型大小、计算量以及功耗等综合性能方面均位居业界前列的预训练模型,引领技术发展潮流。 3、投入模型加速领域的研发,涵盖模型量化、投机采样、模型压缩、模型剪枝、模型蒸馏、网络架构搜索与创新设计等方向,确保模型在效果与运行速度上达到最佳平衡,满足车端需求。 4、开展模型架构的深度探索,包括但不限于Scaling Law、MoE、Transformer、高效训推框架以及基座模型训练等前沿领域,开拓技术边界,为自动驾驶技术突破提供核心支持 。 职位要求 1、熟悉主流自动驾驶算法,熟悉CNN,Transformer以及优化架构原理2、有AutoML、模型量化,蒸馏等相关经验3、熟悉Python开发、算法和数据结构4、具备扎实的研发功底,有在相关领域(IJCV、PAMI、CVPR、ICCV、ECCV、NIPS、AAAI 等)发表论文者优先;或在相关领域竞赛(ImageNet、COCO、Kitti、Waymo、nuScenes等等)中取得较好成绩者优先。 投递...
大模型算法工程师 深圳 社招 全职 职位 ID:A188131 职位描述 1. 面向Agentic OS,参与端侧大模型架构设计与训练、训推一体的端侧大模型新架构探索落地与跨场景执行能力的系统级Agent算法体系建设;目标为通过算法与硬件的协同设计,在极小的功耗和内存预算下,实现极致的模型性能。2. 负责大语言模型、多模态大模型在端侧场景下的继续预训练(CPT)、后训练(SFT, OPD, RL等)及持续学习,构建从数据清洗到模型落地的全链路训练pipeline。3. 针对端侧芯片和内存特性,设计新型模型结构,探索参数共享与稀疏化方案。4. 主导量化感知训练(QAT),实施低比特量化(如INT4/INT8),在保证精度的前提下压缩模型体积与显存占用。5. 运用知识蒸馏(Knowledge Distillation),将云端大模型(Teacher)的能力迁移至端侧小模型(Student),攻克“大改小”的能力衰减难题。6. 建立端侧模型评测体系,不仅关注准确率,更关注首字延迟(Prefill)、生成速度(Decoding)、功耗峰值等硬性指标。7. 前沿技术探索与成果产出,建立Agentic OS的算法创新壁垒,推动顶级会议论文与核心专利产出。 职位要求 1. 硕士及以上学历,人工智能、计算机科学、电子信息技术等相关专业;2. 具备以下至少一到两个方向的深入研究或实践经验:大语言模型、多模态大模型、大模型后训练、大模型预训练、强化学习;3. 深入掌握Transformer架构,了解主流dense和MoE开源模型(Qwen, Deepseek等)的结构设计原理;4. 具备复杂系统建模能力,能够从系统角度设计完整闭环;5. 在 ICML / NeurIPS / ICLR / AAAI / ACL
2026校招-生物应用运营专员-孝感 孝感 校招 正式 职位描述 岗位职责:1、核心方案开发与管理:协助研究团队,参与将专业问题转化为可执行的运营方案,负责关键研究报告、专利文献等合作资料的整理与更新。2、行业研究与信息处理:协助翻译和汇总学术会议资料,跟踪国内外生物医药技术新动态,为项目研发提供信息支持与创新思路。3、活动策划与执行:参与策划和组织线上线下学术交流及沙龙活动,助力提升品牌影响力与用户参与感。4、客户对接与项目协助:协助与客户沟通,跟进项目计算方案和进程,参与问题协调与反馈。 职位要求 岗位要求:1、教育背景:药物设计、计算化学、生物信息学、机器学习、药物经济学等相关专业本科及以上学历。2、专业技能:了解AIDD和CADD基本概念及流程,对常用CADD软件(如MOE、Schrodinger)和分子动力学软件(如Amber)有基础认知者优先。3、文案与创新:具备良好的文案撰写能力和创新意识,能协助撰写和完善运营方案。4、沟通与协作:善于沟通,具备团队合作精神,能够与不同团队积极协作。5、项目管理:具备基础项目管理意识,能在指导下跟进项目进度,助力项目顺利推进。6、个人素质:积极主动,认真负责,能够适应快节奏工作环境,保持高效与专注。7、加分项:欢迎有实习经历、校园项目或相关科研经验的应届生申请。 投递...
2026校招-生物应用运营专员-上海 上海 校招 正式 职位描述 岗位职责:1、核心方案开发与管理:协助研究团队,参与将专业问题转化为可执行的运营方案,负责关键研究报告、专利文献等合作资料的整理与更新。2、行业研究与信息处理:协助翻译和汇总学术会议资料,跟踪国内外生物医药技术新动态,为项目研发提供信息支持与创新思路。3、活动策划与执行:参与策划和组织线上线下学术交流及沙龙活动,助力提升品牌影响力与用户参与感。4、客户对接与项目协助:协助与客户沟通,跟进项目计算方案和进程,参与问题协调与反馈。 职位要求 岗位要求:1、教育背景:药物设计、计算化学、生物信息学、机器学习、药物经济学等相关专业本科及以上学历。2、专业技能:了解AIDD和CADD基本概念及流程,对常用CADD软件(如MOE、Schrodinger)和分子动力学软件(如Amber)有基础认知者优先。3、文案与创新:具备良好的文案撰写能力和创新意识,能协助撰写和完善运营方案。4、沟通与协作:善于沟通,具备团队合作精神,能够与不同团队积极协作。5、项目管理:具备基础项目管理意识,能在指导下跟进项目进度,助力项目顺利推进。6、个人素质:积极主动,认真负责,能够适应快节奏工作环境,保持高效与专注。7、加分项:欢迎有实习经历、校园项目或相关科研经验的应届生申请。 投递...
大模型推理架构师 上海 社招 全职 互联网 / 电子 / 网游 职位描述 1. 参与 Soul 大模型、多模态模型、推荐模型等核心 AI 任务的训练与推理基础设施建设,提升模型从实验到线上部署的整体效率。2. 负责大规模分布式训练系统的性能优化,包括数据并行、张量并行、流水线并行、专家并行、参数/梯度/优化器状态切分、显存优化、通信调度等方向,提升 GPU/NPU 集群利用率。3. 参与高性能推理引擎建设,围绕大模型在线服务中的低延迟、高吞吐、弹性扩缩容、多租户隔离、KV Cache 管理、批处理调度、量化部署等问题进行系统优化。4. 针对 Soul 的实时社交、多模态内容理解、AIGC 互动等场景,设计和优化端到端 AI 系统架构,降低训练和推理成本,保障核心业务的稳定性和体验质量。5. 参与异构计算算子优化和计算图优化,包括 CUDA、Triton、CUTLASS、Ascend C、TileLang 等方向,针对 Attention、MoE、Embedding、推荐模型特征交互、多模态编码等关键模块进行性能调优。6. 参与 AI 编译器和模型编译优化相关工作,围绕 IR
提前批-车端大模型与世界模型系统架构工程师 上海 校招 正式 数字技术 - 软件测试 博士及以上 2027届校园招聘-技术提前批 职位 ID:A159991A 职位描述 岗位定位我们正在建设下一代智能汽车 AI 计算与系统架构。未来车端将同时承载智能辅助驾驶世界模型、VLA / VLM 模型、座舱多模态大模型、车端 Agent、安全 Agent 等多类 AI 工作负载。架构团队不直接以训练模型为唯一目标,而是负责把模型能力、模型演进趋势和业务体验目标,转化为芯片、OS、内存、存储、通信、隔离、数据闭环和软件平台的系统架构设计。我们希望招聘具备大模型后训练、世界模型或 VLA 模型背景的博士校招生,成为 AI 模型团队和整车系统架构团队之间的桥梁。你将负责跟踪和理解大模型后训练、强化学习、偏好对齐、多模态模型、世界模型、VLA / VLM 等方向的技术演进,判断其对车端系统架构的影响。将模型需求转化为可落地的系统架构指标,包括但不限于算力、显存 / 内存容量、内存带宽、KV cache、上下文长度、模型并发、模型隔离、端侧推理延迟、功耗和热设计约束。面向智能辅助驾驶、智能座舱、车端 Agent 等场景,参与设计下一代车端 AI
世界模型算法实习生 急招 北京、上海 实习 互联网 / 电子 / 网游 - 研发 日常实习生 职位描述 我们致力于打造面向真实物理世界的生成式世界模型,依托Momenta海量真实物理交互数据,聚焦先进模型架构设计与大规模Scaling,构建具备物理一致性、长时序推理与可交互能力的下一代AI 基础模型。团队覆盖视频生成、多模态统一理解与生成、VLA、端侧Policy Model、离线Sim2Real全链路,提供行业最一线、最核心的研发机会,推动技术从模型创新到Physical AI在真实场景落地。1、负责高保真、物理自洽视频生成世界模型研发。包括扩散模型、时序建模、长视频生成、高性能多模态表征探索与推理优化算法研发和前沿探索,构建可预测、可交互、具备物理约束的生成式世界模型;2、深耕世界模型前沿架构设计,探索物理世界的Scaling Law。推进模型架构往理解生成统一,MoE/MoT等前沿架构演进。结合大规模真实数据,推进模型工程化、性能极致化与规模化迭代;3、参与端侧Policy Model与离线Sim2Real全链路研发,打通仿真生成与真实世界决策闭环,支撑自动驾驶等核心场景落地。 职位要求 1、扎实的深度学习基础,熟练使用PyTorch,具备优秀的前沿视野、工程实现与问题定位能力;2、掌握一种以上分布式训练框架、具有大规模集群训练或模型Scaling经验;3、自驱力强,逻辑清晰,具备良好的沟通协作与技术攻坚能力,热爱前沿 AI 技术与真实场景落地。加分项1、精通世界模型/视频生成核心技术,具备模型从0到1搭建、迭代与落地经验,追求技术极致与长期价值;2、多模态其他方向(语音/图像/3D/VLA等)完整研发经验,熟悉预训练、微调、对齐全流程;具备强技术迁移能力,强烈意愿深耕视频生成、世界模型与物理AI方向,能独立攻坚与推进项目;3、Policy Model、Sim2Real、机器人/自动驾驶感知/决策相关经验;4、开源项目贡献者或顶会论文作者。 投递...
AI应用工具链开发工程师 南京 全职 互联网 / 电子 / 网游 - 研发 职位描述 1.负责AI模型(如CNN、LLM、Vision LLM、MoE 等)的量化方案调试,提升模型在推理部署阶段的效率与精度;2.负责主流AI模型在自研NPU上的移植、demo开发和优化,包括精度测试、性能分析、调优及芯片架构协同设计(如互联结构、专用加速单元等);3.分析客户模型和方案特点,及自研NPU推理瓶颈,制定对应的推理优化与量化策略,提升部署效果;4.跟踪AI领域最新研究成果和技术动态(特别是大模型量化和推理加速技术),评估其在实际产品中的应用潜力和落地价值,及时为公司和团队引入优秀的前沿技术和方案; 职位要求 1.扎实的C/C++、Python基础,熟悉至少一种深度学习框架(如TensorFlow、PyTorch、JAX等);2.对AI算法和应用有深刻的理解,熟练掌握机器学习、深度学习、强化学习等理论知识,具备模型训练与部署的完整开发经验;3.有下列实际项目经验(至少一项):模型量化工具开发、模型推理(加速)框架开发、GPU/TPU/NPU算子开发、AI处理器设计等;4.对 AI 模型压缩有深入理解,至少具备以下一项实际开发经验:1)量化工具链开发(如 PTQ、QAT、混合精度推理等);2)推理加速框架优化(如 ONNX Runtime、TensorRT、TVM、XLA 等);3)GPU/TPU/NPU 等异构硬件的算子开发与性能调优;4)AI 芯片架构设计与软件协同开发;5.具备良好的科研能力或工程创新能力,在模型压缩/推理优化领域的国际顶会(如 NeurIPS、ICLR、CVPR、MLSys 等)有论文发表者优先; 投递...
算法优化工程师-实习 北京 校招 实习 算法类 职位描述 1、参与自动驾驶通用算法、端到端、vlm、vla前沿研发项目,协助运用算法-硬件协同设计、网络结构优化等技术,整理并分析训练部署数据,为业务团队提供基础支持;2、辅助进行模型轻量化结构设计相关工作,参与模型性能测试,协助雕琢模型性能,为研发高性能预训练模型贡献力量;3、投身于模型加速领域的学习与实践,参与模型量化、压缩等基础工作,协助完成实验数据收集与整理,助力模型达到效果与速度的平衡;4、探索模型架构相关知识,研读ScalingLaw、Transformer、MoE、vlm、vla、llm等前沿资料,协助开展技术调研,为自动驾驶技术突破提供基础思路。 职位要求 1、了解主流自动驾驶算法,了解CNN、图像特征提取backbone、视觉检测、分割、多模态、llm等模型架构、Transformer等架构原理,在校期间有相关课程学习或研究经历;2、对AutoML、模型量化、蒸馏等方向有兴趣,主动学习并尝试相关实践;3、掌握Python基础语法,了解算法和数据结构基本概念;4、学习能力强,对科研工作有热情,在相关学术期刊、会议发表过论文,或在相关竞赛中取得成绩者优先。 投递...
AI 院-多模态团队-多模态理解算法研究员 北京 全职 互联网 / 电子 / 网游 职位描述 【团队介绍】智谱多模态大模型团队是全球领先的多模态研究团队之一,专注于推动视觉语言大模型的认知与推理能力的突破。团队拥有从多模态理解到生成的全栈自研技术体系,依托强大的计算资源和全链路研发能力,持续引领行业创新。团队负责多模态基座模型研发(视觉语言模型+多模态生成模型),先后推出GLM-V系列多模态基座模型,以及GLM-Image、CogView、CogVideo等前沿生成模型。2025年连续发布GLM-4.1V-Thinking、GLM4.5V和GLM-4.6V系列模型,其中GLM-4.1V-Thinking创新性地引入思维链推理机制,采用课程采样强化学习策略,系统性提升模型跨模态因果推理能力与稳定性,在28项业界权威评测中有23项达成10B级模型的最佳成绩(SOTA);而GLM-4.5V采用MoE架构(总参数106B、激活参数12B),在100B级视觉推理模型中树立起新的标准,在41个业界主流benchmark上达到同级别SOTA,且OCR、视频理解、AI解题、长文档解读、前端复刻、空间定位与推理等核心能力获得显著提升;GLM-4.6V则在多模态感知和深度推理方面进一步增强,且支持128k long-context、多模态工具调用和图文交错输出,为执行复杂、长程、多模态Agentic任务奠定坚实基础;9B版本的GLM-4.6V-Flash整体表现超过 Qwen3-VL-8B,106B参数12B激活的GLM-4.6V表现比肩2倍参数量的Qwen3-VL-235B。顺应技术发展趋势和业界需求,2026年初团队研发和开源GLM-Image和GLM-OCR。前者是智谱新旗舰图像生成模型,全程基于国产芯片完成训练,采用独创的「自回归+扩散解码器」混合架构,兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景生成难题,是面向以Nano Banana Pro为代表的新一代「认知型生成」技术范式的一次重要探索。GLM-OCR则是轻量级OCR和文档解析专用模型,以“小尺寸、高精度”树立新标杆,其性能登顶 OmniDocBench,擅长公式、手写体、表格等高难场景,仅 0.9B 参数,推理高效易部署,在HuggingFace上获得超过360万下载量。【岗位职责】1、 设计和训练先进的多模态大模型,包括图像、视频的理解与生成;2、 搭建与优化多模态大模型的自动化数据通路,提升模型的多模态基础能力及下游任务上的效果;3、优化模型训练,包括包括模型的预训练、微调、偏好对齐等;4、探索前沿算法,多模态理解的数据合成、模型自我迭代等;5、加速多模态大模型的推理过程并部署到实际应用中。 职位要求 1、985高校计算机、电子、自动化等相关专业硕士或博士学位(优秀本科生亦可考虑);2、深入理解常用多模态算法;具备多模态大模型和视频理解相关项目经验者优先;3、在CCF-A类会议发表过多模态相关论文者优先考虑;4、熟练运用Pytorch、transformers、megatron等主流框架;5、工作态度认真负责,具备良好的团队协作能力。 加入我们,您将有机会:1、参与突破性的多模态AI研究;2、与顶尖专家共事,快速提升技能;3、在充满活力的环境中实现自我价值;我们期待您的加入,一同推动AI技术的前沿发展! 投递...
AI 院-多模态理解-训练框架算法工程师 北京 全职 互联网 / 电子 / 网游 职位描述 【团队介绍】智谱多模态大模型团队是全球领先的多模态研究团队之一,专注于推动视觉语言大模型的认知与推理能力的突破。团队拥有从多模态理解到生成的全栈自研技术体系,依托强大的计算资源和全链路研发能力,持续引领行业创新。团队负责多模态基座模型研发(视觉语言模型+多模态生成模型),先后推出GLM-V系列多模态基座模型,以及GLM-Image、CogView、CogVideo等前沿生成模型。2025年连续发布GLM-4.1V-Thinking、GLM4.5V和GLM-4.6V系列模型,其中GLM-4.1V-Thinking创新性地引入思维链推理机制,采用课程采样强化学习策略,系统性提升模型跨模态因果推理能力与稳定性,在28项业界权威评测中有23项达成10B级模型的最佳成绩(SOTA);而GLM-4.5V采用MoE架构(总参数106B、激活参数12B),在100B级视觉推理模型中树立起新的标准,在41个业界主流benchmark上达到同级别SOTA,且OCR、视频理解、AI解题、长文档解读、前端复刻、空间定位与推理等核心能力获得显著提升;GLM-4.6V则在多模态感知和深度推理方面进一步增强,且支持128k long-context、多模态工具调用和图文交错输出,为执行复杂、长程、多模态Agentic任务奠定坚实基础;9B版本的GLM-4.6V-Flash整体表现超过 Qwen3-VL-8B,106B参数12B激活的GLM-4.6V表现比肩2倍参数量的Qwen3-VL-235B。顺应技术发展趋势和业界需求,2026年初团队研发和开源GLM-Image和GLM-OCR。前者是智谱新旗舰图像生成模型,全程基于国产芯片完成训练,采用独创的「自回归+扩散解码器」混合架构,兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景生成难题,是面向以Nano Banana Pro为代表的新一代「认知型生成」技术范式的一次重要探索。GLM-OCR则是轻量级OCR和文档解析专用模型,以“小尺寸、高精度”树立新标杆,其性能登顶 OmniDocBench,擅长公式、手写体、表格等高难场景,仅 0.9B 参数,推理高效易部署,在HuggingFace上获得超过360万下载量。【岗位职责】参与GLM系列多模态大模型,CogVLM、CogView、CogVideo系列多模态理解生成模型训练框架 职位要求 1、统招硕士及以上学历,计算机或相关专业;2、熟练掌握Pytorch,具有模型训练经验;3、熟悉Transformer结构,对常见模型的训练方法有所了解,例如BERT、GPT、ViT、CLIP;4、有模型迁移、精度对齐经验,能够在新框架中适配新的模型;5、对常见的大模型训练优化有所了解,能够迅速熟悉掌握,根据需求进行修改;6、对Megatron框架有一定的了解,能够借鉴其他框架,完善优化已有的框架。 投递...
AI院-多模态音频-算法实习生 北京 实习 互联网 / 电子 / 网游 职位描述 【团队介绍】智谱多模态大模型团队是全球领先的多模态研究团队之一,专注于推动视觉语言大模型的认知与推理能力的突破。团队拥有从多模态理解到生成的全栈自研技术体系,依托强大的计算资源和全链路研发能力,持续引领行业创新。团队负责多模态基座模型研发(视觉语言模型+多模态生成模型),先后推出GLM-V系列多模态基座模型,以及GLM-Image、CogView、CogVideo等前沿生成模型。2025年连续发布GLM-4.1V-Thinking、GLM4.5V和GLM-4.6V系列模型,其中GLM-4.1V-Thinking创新性地引入思维链推理机制,采用课程采样强化学习策略,系统性提升模型跨模态因果推理能力与稳定性,在28项业界权威评测中有23项达成10B级模型的最佳成绩(SOTA);而GLM-4.5V采用MoE架构(总参数106B、激活参数12B),在100B级视觉推理模型中树立起新的标准,在41个业界主流benchmark上达到同级别SOTA,且OCR、视频理解、AI解题、长文档解读、前端复刻、空间定位与推理等核心能力获得显著提升;GLM-4.6V则在多模态感知和深度推理方面进一步增强,且支持128k long-context、多模态工具调用和图文交错输出,为执行复杂、长程、多模态Agentic任务奠定坚实基础;9B版本的GLM-4.6V-Flash整体表现超过 Qwen3-VL-8B,106B参数12B激活的GLM-4.6V表现比肩2倍参数量的Qwen3-VL-235B。顺应技术发展趋势和业界需求,2026年初团队研发和开源GLM-Image和GLM-OCR。前者是智谱新旗舰图像生成模型,全程基于国产芯片完成训练,采用独创的「自回归+扩散解码器」混合架构,兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景生成难题,是面向以Nano Banana Pro为代表的新一代「认知型生成」技术范式的一次重要探索。GLM-OCR则是轻量级OCR和文档解析专用模型,以“小尺寸、高精度”树立新标杆,其性能登顶 OmniDocBench,擅长公式、手写体、表格等高难场景,仅 0.9B 参数,推理高效易部署,在HuggingFace上获得超过360万下载量。【岗位职责】1. 从事音频算法研究、训练、应用,具体业务包括Omni-音频理解、同声传译、video-audio联合生成等2. 探索语音/音频技术前沿技术,探索音频理解、音频表征、音视频联合生成的新范式3. 负责模型的多机多卡训练、高性能推理、数据集构建、评测系统搭建等 职位要求 【职位要求】1. 自然语言处理、机器学习、人工智能、软件工程等相关专业,硕士及以上学历;2. 较强的算法开发能力,熟悉常用的机器学习、深度学习算法;3. 熟练使用Python和Pytorch/Tensorflow深度学习框架;4. 熟悉以下至少一种,且有相应研发经验优先,大模型的框架&理论(如Diffusion、Vall-E/SpearTTS/AudioLM、MusicLM等);5. 具备优秀的代码能力和基础算法功底,有较为丰富的工程经验,有大规模训练经验或大规模数据处理经验。加分项:1. 在ACL,NeurIPS,ICLR,EMNLP,ICML等顶级会议或期刊上发表过论文者优先;2. 熟悉并行训练框架,有多机多卡训练经验者优先。 投递...
AI院-多模态团队-多模态生成算法研究员 北京 全职 互联网 / 电子 / 网游 职位描述 【团队介绍】智谱多模态大模型团队是全球领先的多模态研究团队之一,专注于推动视觉语言大模型的认知与推理能力的突破。团队拥有从多模态理解到生成的全栈自研技术体系,依托强大的计算资源和全链路研发能力,持续引领行业创新。团队负责多模态基座模型研发(视觉语言模型+多模态生成模型),先后推出GLM-V系列多模态基座模型,以及GLM-Image、CogView、CogVideo等前沿生成模型。2025年连续发布GLM-4.1V-Thinking、GLM4.5V和GLM-4.6V系列模型,其中GLM-4.1V-Thinking创新性地引入思维链推理机制,采用课程采样强化学习策略,系统性提升模型跨模态因果推理能力与稳定性,在28项业界权威评测中有23项达成10B级模型的最佳成绩(SOTA);而GLM-4.5V采用MoE架构(总参数106B、激活参数12B),在100B级视觉推理模型中树立起新的标准,在41个业界主流benchmark上达到同级别SOTA,且OCR、视频理解、AI解题、长文档解读、前端复刻、空间定位与推理等核心能力获得显著提升;GLM-4.6V则在多模态感知和深度推理方面进一步增强,且支持128k long-context、多模态工具调用和图文交错输出,为执行复杂、长程、多模态Agentic任务奠定坚实基础;9B版本的GLM-4.6V-Flash整体表现超过 Qwen3-VL-8B,106B参数12B激活的GLM-4.6V表现比肩2倍参数量的Qwen3-VL-235B。顺应技术发展趋势和业界需求,2026年初团队研发和开源GLM-Image和GLM-OCR。前者是智谱新旗舰图像生成模型,全程基于国产芯片完成训练,采用独创的「自回归+扩散解码器」混合架构,兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景生成难题,是面向以Nano Banana Pro为代表的新一代「认知型生成」技术范式的一次重要探索。GLM-OCR则是轻量级OCR和文档解析专用模型,以“小尺寸、高精度”树立新标杆,其性能登顶 OmniDocBench,擅长公式、手写体、表格等高难场景,仅 0.9B 参数,推理高效易部署,在HuggingFace上获得超过360万下载量。【岗位职责】负责图像/视频生成模型训练及数据优化 职位要求 1、985高校计算机、电子、自动化等相关专业硕士或博士学位(优秀本科生亦可考虑);2、深入理解常用多模态算法;具备多模态大模型和视频理解相关项目经验者优先;3、在CCF-A类会议发表过多模态相关论文者优先考虑;4、熟练运用Pytorch、transformers、megatron等主流框架;5、工作态度认真负责,具备良好的团队协作能力。 【加分项】 - 在ACL,NeurIPS,ICLR,EMNLP,ICML等顶级会议或期刊上发表过论文者优先; - 熟悉并行训练框架,有多机多卡训练经验者优先。 投递...
AI 院-多模态团队-多模态理解算法研究员-强化学习方向 北京 全职 互联网 / 电子 / 网游 职位描述 【团队介绍】智谱多模态大模型团队是全球领先的多模态研究团队之一,专注于推动视觉语言大模型的认知与推理能力的突破。团队拥有从多模态理解到生成的全栈自研技术体系,依托强大的计算资源和全链路研发能力,持续引领行业创新。团队负责多模态基座模型研发(视觉语言模型+多模态生成模型),先后推出GLM-V系列多模态基座模型,以及GLM-Image、CogView、CogVideo等前沿生成模型。2025年连续发布GLM-4.1V-Thinking、GLM4.5V和GLM-4.6V系列模型,其中GLM-4.1V-Thinking创新性地引入思维链推理机制,采用课程采样强化学习策略,系统性提升模型跨模态因果推理能力与稳定性,在28项业界权威评测中有23项达成10B级模型的最佳成绩(SOTA);而GLM-4.5V采用MoE架构(总参数106B、激活参数12B),在100B级视觉推理模型中树立起新的标准,在41个业界主流benchmark上达到同级别SOTA,且OCR、视频理解、AI解题、长文档解读、前端复刻、空间定位与推理等核心能力获得显著提升;GLM-4.6V则在多模态感知和深度推理方面进一步增强,且支持128k long-context、多模态工具调用和图文交错输出,为执行复杂、长程、多模态Agentic任务奠定坚实基础;9B版本的GLM-4.6V-Flash整体表现超过 Qwen3-VL-8B,106B参数12B激活的GLM-4.6V表现比肩2倍参数量的Qwen3-VL-235B。顺应技术发展趋势和业界需求,2026年初团队研发和开源GLM-Image和GLM-OCR。前者是智谱新旗舰图像生成模型,全程基于国产芯片完成训练,采用独创的「自回归+扩散解码器」混合架构,兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景生成难题,是面向以Nano Banana Pro为代表的新一代「认知型生成」技术范式的一次重要探索。GLM-OCR则是轻量级OCR和文档解析专用模型,以“小尺寸、高精度”树立新标杆,其性能登顶 OmniDocBench,擅长公式、手写体、表格等高难场景,仅 0.9B 参数,推理高效易部署,在HuggingFace上获得超过360万下载量。岗位职责:学科解题方向,负责VLM的混合SFT/RL训练优化及RL训练的数据处理,通过人类偏好学习提升多模态大模型的对齐和推理能力。 职位要求 1、统招硕士及以上学历,计算机科学/机器学习/人工智能相关专业;2、0-3年工作经验,在NLP/CV/RL等至少一个AI领域有过深入的研究经历;3、熟悉主流的多模态大模型,能持续跟进学术界和工业界的最新研究和产品;4、熟悉强化学习,有RLHF/DPO训练经验者优先;熟悉Linux,Python,Pytorch和Transformer,了解分布式训练框架如Deepspeed,Megatron-LM等;5、了解对多模态数据(如文本、图像、视频、音频等)的基本处理,能够独立完成数据收集、清洗和构造的pipeline; 投递...