原点星辉推出开源决策模型 智能体“高频判断”迎来专用方案
来源:新华财经
原点星辉推出开源决策模型 智能体“高频判断”迎来专用方案
StartLux-Decision决策模型将专用决策能力带到操作页面、分配任务和调用工具等环节,让高频判断有机会减少不必要的等待,让复杂问题及时转交合适的模型或人。
新华财经上海10月1日电(记者 高少华)9月30日,上海原点星辉科学技术有限公司(下称StartLux)宣布开源决策模型系列StartLux-Decision,一次性推出0.8B至27B五档参数版本,面向智能体在执行任务过程中的高频判断环节提供专用组件。
近年来,大语言模型在文本生成、复杂推理等领域快速发展,但在智能体实际执行任务时,大量决策并不需要生成完整文本,而是需要在若干预设选项中快速作出选择。每一步判断的等待时间累积起来,将直接影响整体效率。
今年9月,由前OpenAI研究员迪奥戈·阿尔梅达(Diogo Almeida)创办的TypeSafe AI推出决策模型Jev,以“不生成文本、只输出结构化判断”的思路引发行业关注。Jev发布后快速走红,也推动决策模型这一专用方向进入更多开发者的视野。
“Jev为大模型领域带来了一条全新的技术思路,在决策效率与响应速度上展现出很强的潜力。我们也高度认可这一技术方向。”原点星辉方面表示,智能体真正执行任务时,每一步等待都会累积,最终影响用户体验。
为此,原点星辉将团队自建的AI自动研究方法用于决策模型研发,用3天时间完成了StartLux-Decision的研发与验证,并一次性推出0.8B、2B、4B、9B、27B五档参数版本。AI自动研究研发管线也是原点星辉推进递归式自我改进(RSI)的核心路径之一,它让人工智能深度参与数据构造、训练、评测与失败分析,加快模型迭代。
据原点星辉联合创始人兼首席技术官郭权玮此前介绍,团队自建的AI自动研究方法将人工智能引入实验假设提出、数据构造、训练评测和失败分析等环节,形成“假设—实验—验证—新假设”的闭环,约70%的实验研发工作由人工智能独立完成,人类研究员主要负责研究方向和关键取舍。此次决策模型的快速迭代,正是依托这一研发管线实现的成果。
原点星辉公布的评测数据显示,在独立的Decision Index 0.2.1评测中,StartLux-Decision-27B版本得分63.88,38项基准中有31项高于Jev 1.13;在上海人工智能实验室(上海AI实验室)发布“书生·明决”决策模型时采用的七项评测中,StartLux-Decision-27B版本的平均准确率达到91.82%,Jev为88.74%。
作为一款国产自研决策模型,StartLux-Decision目前具备一次计算完成多个判断、从单步判断走向连续网页操作、以毫秒级响应支撑高频判断、以量化版本推进本地部署、以AI自动研究驱动决策模型迭代等特点。
“从一次判断到连续执行,原点星辉关注的是智能体如何把任务做得更顺畅。”原点星辉方面表示,StartLux-Decision决策模型将专用决策能力带到操作页面、分配任务和调用工具等环节,让高频判断有机会减少不必要的等待,让复杂问题及时转交到合适的模型或人。围绕这些真实任务,原点星辉将继续推进模型、推理系统与智能体执行能力的协同,让研发成果更直接地服务任务完成。
编辑:李一帆
(来源:新华财经 编辑:张明艳)