腾讯混元优化Hy4 preview 降低任务轮次与Token消耗
驱动中国9月7日消息,腾讯混元与WorkBuddy联合团队今日宣布,针对其Hy4 preview模型在复杂任务处理中暴露出的“长思考”与“过度自我验证”等性能瓶颈,已完成专项优化并正式全量上线。此次更新旨在提升模型在多轮交互中的决策效率,同时降低对计算资源的依赖。
据团队介绍,优化工作是在对大量复杂任务场景进行Bench指标监控和人工评测双重把关的基础上展开的。经过调整后的模型,在保持原有任务完成效果不降级的前提下,显著减少了完成任务所需的交互轮次,以及输入和输出环节的token消耗量。这一变化对于依赖大模型进行高频业务处理的企业而言,意味着更低的推理成本和更快的响应速度。

所谓“长思考”,是指模型在面对复杂指令时容易触发过长的内部推理链,产生大量中间步骤;“过度自我验证”则表现为模型反复检查自身答案,甚至进行不必要的确认性操作。这两种问题叠加,不仅拉长了任务完成时间,也推高了token使用量,成为影响模型规模化落地的关键障碍。
从产品维度看,Hy4 preview是腾讯混元大模型家族中的重点版本。腾讯于8月28日正式推出该模型,其总参数规模达到770B,激活参数为49B,上下文长度则扩展至1M。这一配置使其能够处理超长文本和复杂上下文关联任务,在模型尺寸、上下文长度和数据规模等方面都实现了显著跃升。
腾讯官方此前表示,Hy4 preview在预训练和后训练两个阶段的协同进步,带动了整体智能水平的又一次提升,并将其定位为“稳居开源模型第一梯队”。此次针对推理效率的专项优化,可以视作腾讯混元在模型工程化落地方面的重要补强,尤其有利于企业级用户在实际业务中更经济地调用长上下文能力。
从行业视角观察,大模型在复杂任务中的“过度思考”问题并非个案,而是当前生成式AI应用面临的普遍痛点。许多模型在追求高准确率时,往往以更高的token消耗和更长的响应时延为代价。腾讯混元此次选择在不损害效果的前提下压缩推理路径,反映了行业对“高效智能”的追求正从单纯参数比拼转向性价比与实用性的平衡。
联合团队表示,后续将持续跟踪优化版本在真实场景中的表现,并依托Bench指标与人工评测体系,进一步打磨模型在长文本、多步推理等任务上的综合能力。对于开发者与下游应用方而言,此次全量上线意味着可以立即在腾讯混元相关服务中体验到更精简的交互流程和更可控的成本结构。
总体而言,Hy4 preview的这次升级虽是一次“内部优化”,但其外溢效应将直接传导至使用该模型的应用产品。在开源大模型竞争进入深水区的当下,效率优化正在成为继参数规模、上下文长度之后的又一关键竞争维度。腾讯混元选择在发布仅数周后快速跟进这一轮调整,也显示出其对市场反馈的响应速度和技术迭代的组织效率。