🇺🇸 USAJobs.work

America's Job Portal

← Back to USA Jobs

混元Agent后训练算法工程师(北京/上海/深圳)

Company

Tencent

Location

Beijing, Beijing

Posted

July 19, 2026

Position Overview

混元Agent后训练算法工程师(北京/上海/深圳) 北京 分享

分享岗位

方式1:复制岗位链接

方式2:分享岗位海报

手机扫描二维码分享

收藏 TEG 点击了解更多BG信息 技术 一年以上工作经验 更新于年06月22日 岗位职责
  • 1.Agent 后训练算法设计与实现:主导基模大模型的 Agent 化后训练方案研发,包括指令微调(SFT)、奖励模型(RM)训练、强化学习(RLHF/RLAIF)优化,聚焦任务规划、记忆机制、工具调用、多轮对话一致性等核心能力提升。​;
    2.后训练数据体系构建:设计 Agent 后训练数据的采集、清洗、标注与迭代策略,涵盖通用指令集、任务型对话数据、工具调用样本、多模态交互数据等,建立数据质量评估与筛选机制,优化数据分布与多样性。​;
    3.Agent 能力优化与突破:针对 Agent 在复杂任务拆解、跨领域知识迁移、动态环境适配等场景的痛点,研发创新后训练算法(如分层任务规划训练、多智能体协作训练、反幻觉优化),提升 Agent 的决策准确性与鲁棒性。​;
    4.工程化落地与系统协作:搭建高高效后训练流水线,支持大规模数据并行处理、分布式训练(DDP/FSDP)与模型压缩部署;与产品、工程团队协作,打通 “后训练 - 评测 - 迭代” 闭环,适配不同场景下的 Agent 产品需求。​;
    5.技术创新与沉淀:跟踪大模型 Agent 领域前沿技术(如 LLM+Planning、Tool Learning、Multi-Agent Interaction),主导核心技术攻关与专利申请;输出可复用的后训练算法组件、技术文档与评测基准,推动团队技术能力沉淀。
  • 岗位要求
  • 1.计算机科学、人工智能、机器学习等相关专业硕士及以上学历,1年以上大模型后训练或 Agent 相关研发经验。​;
    2.扎实的算法基础:精通深度学习、强化学习、自然语言处理核心理论,深入理解大模型训练原理、Transformer 架构及 Agent 决策机制。​;
    3.工程能力扎实:熟练掌握 Python 编程语言,精通 PyTorch/TensorFlow 框架及 HuggingFace...
  • Ready to Apply?

    Join thousands of Americans building their careers

    Apply Now