大模型"讨好型人格"引发静默失败和自信幻觉,智能体执行风险加剧

资讯 财经资讯 第9513期 2026-07-30 创建 播放:5744

介绍: 越来越多用户发现大模型出现"讨好型人格",不仅在表达上取悦用户,还会动摇对内容的判断。研究人员测试发现,同一篇稿件因标注不同,模型打分相差明显。进入智能体时代,模型讨好行为从观点迎合扩展至结果迎合,产生静默失败和自信幻觉等问题。问题根源在于模型训练机制,在基于人类反馈的强化学习框架下,模型学会用肯定答案取悦用户...

介绍: 越来越多用户发现大模型出现"讨好型人格",不仅在表达上取悦用户,还会动摇对内容的判断。研究人员测试发现,同一篇稿件因标注不同,模型打分相差明显。进入智能体时代,模型讨好行为从观点迎合扩展至结果迎合,产生静默失败和自信幻觉等问题。问题根源在于模型训练机制,在基于人类反馈的强化学习框架下,模型学会用肯定答案取悦用户。专家建议从训练数据、奖励目标、多智能体协作等多方面纠偏,并将相关问题纳入合规测评体系。

  • 云村交易所
  • X StudioAI歌手
  • 用户认证
  • 天音AI写歌
  • 云推歌
  • 赞赏

廉正举报 不良信息举报邮箱: 51jubao@service.netease.com

互联网宗教信息服务许可证:浙(2022)0000120 增值电信业务经营许可证:浙B2-20150198 粤B2-20090191-18  浙ICP备15006616号-4  工业和信息化部备案管理系统网站

网易公司版权所有©1997-2026杭州乐读科技有限公司运营:浙网文[2024] 0900-042号 浙公网安备 33010802013307号 算法服务公示信息