AI 透镜
← 返回首页
模型发布 arXiv cs.AI

Palmyra x6 技术报告:锚定微调的企业智能体模型 Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

精读摘要

这篇技术报告介绍了 Palmyra x6——基于混合专家(MoE)基座模型后训练得到的大语言模型,专门面向企业级智能体任务优化。训练方案刻意保守且可控:仅用 626 条经过验证的合成工具调用轨迹、单轮训练、低学习率,并以 KL 散度锚定冻结的基座模型,配合 Muon+Adam 混合优化器。结果显示该模型相比此前的默认模型有显著提升,说明精心筛选的少量数据同样能带来可观收益。 Palmyra x6 is an LLM optimized for enterprise agentic tasks, built by post-training a Mixture-of-Experts base model with Anchored Supervised Fine-Tuning. The recipe is deliberately conservative: 626 verified synthetic tool-use trajectories, a single epoch, a low learning rate, and a KL anchor to the frozen base, optimized with a Muon + Adam hybrid. It shows substantial gains over the previous default model.

关键要点

  • 基于 MoE 基座模型后训练,面向企业级智能体任务优化
  • 仅用 626 条验证过的合成工具调用轨迹完成训练
  • 单轮、低学习率加 KL 锚定的保守方案取得显著提升

💡 对普通人的影响:企业用户使用 Writer 相关产品时,未来可能获得更可靠的智能体工具调用体验。

#Palmyra #Writer #agent #post-training 阅读原文 ↗