不知道大家有没有这种感觉:和AI机器人短时间聊天的话还行,时间一长,就感觉对话开始变的前言不搭后语、逻辑不通。
其实这种感觉并不是错觉。
最近,微软发表的一项研究证实,即使是目前最先进的大语言模型,在多轮对话中的可靠性也会急剧下降。
研究人员对包括 GPT-4.1、Gemini 2.5 Pro、Claude 3.7 Sonnet、o3、DeepSeek R1 和 Llama 4 在内的 15 款顶尖模型进行了超过 20 万次模拟对话分析,揭示出一个被称为“迷失会话”的系统性缺陷。
数据显示,这些模型在单次提示任务中的成功率可达 90%,但当同样的任务被拆解成多轮自然对话后,成功率骤降至约 65%。
研究指出,模型的核心能力仅降低约 15%,但“不可靠性”却飙升 112%。
也就是说,AI 大模型仍然具备解决问题的能力,但在多轮对话中变得高度不稳定,难以持续跟踪上下文。
研究人员进一步分析了造成性能下降的行为机制。
首先是“过早生成”。模型在用户尚未完整说明需求前就尝试给出最终答案。一旦在早期回合中形成错误***设,模型后续便会在该错误的基础上继续推理,而不是随着新信息的加入进行修正,从而导致错误逐步放大。
其次是“答案膨胀”。在多轮对话中,模型的回复长度比单轮对话增加了 20% 至 300%。更长的回答往往包含更多***设与“幻觉”,这些内容随后被纳入对话的持续上下文,从而进一步影响后续推理的准确性。
令人意外的是,即使是配备了额外“思考词元”(thinking tokens)的新一代推理模型,如 OpenAI o3 和 DeepSeek R1,也未能显著改善在多轮对话中的表现。
研究人员指出,现有的基准测试主要基于理想的单轮场景,忽略了模型在真实世界中的行为。
因此,对于那些依赖 AI 构建复杂对话流程或智能体的开发者而言,这一结论意味着未来将要接受严峻挑战。
再来看看其他消息。
微软日前测试 Windows 11新版“画图”(Paint)应用,重点引入“自由旋转”功能。
根据微软官方描述,用户现在可以全方位角度调整形状、文本框以及任何活动的图像选区。用户选中对象后,其上方会出现一个“旋转手柄”,用户只需拖动该手柄即可向任意方向自由旋转对象,从而实现更自然的构图和布局。
除了直观的手动拖拽,微软还为需要高精度编辑的用户提供了解决方案。在“旋转”菜单下新增了“自定义旋转”选项,用户可以在此输入具体的角度数值,实现精确到 1 度的微调。返回搜狐,查看更多
K2.5的取向是一次有迹可循的战略聚焦,标志着月之暗面在大模型能力谱系中的位置迁移:其技术标签已从2024年的“长文本”,转向2025年的复杂推理、思考过程与Agent任务协同。公司能够持续推出模型、持续完…...
2026-09-20 来源: 浏览: 次
我简单看了一下,智谱这次测的这个 CC-bench-V2,主要考验的是你模型补全代码的能力有多强。 但 比较遗憾的是,因为这次上手的时间实在太短,世超没法拿那些真正复杂的业务代码去***“拷打”一下它,看看它…...
2026-09-20 来源: 浏览: 次
【CNMO科技消息】2月2日,阿里旗下AI助手“千问”宣布将投入30亿元发起春节“请客”***,邀请用户感受AI时代的“吃喝玩乐”。这标志着,继腾讯“元宝”豪掷10亿、百度“文心”发放5亿红包后,中国互联网公司…...
2026-09-20 来源: 浏览: 次
京东春节要发超13亿元给一线员工!通过加班费、过大年红包、子女团聚补贴等形式_***_物流_保障...
2026-09-20 来源: 浏览: 次
据雷军介绍,自2024年3月启用至今,小米汽车工厂有两个重要特点:一是高度智能化,工厂里面有六七百台机器人,可以做到组装的所有环节是百分之百自动组装,检测也是百分之百自动检测;二是绿色环保,小米汽车整个厂房…...
2026-09-21 来源: 浏览: 次
字节阿里DeepSeek决战春节:一场关乎14亿人的重磅AI大战_模型_中国_用户...
2026-09-19 来源: 浏览: 次
既然能被库克用“史无前例的创新”来形容,显然就不是简单的产品迭代更新了,在“后智能手机时代”与AI浪潮的夹击下,苹果已经在软件生态上慢了一步,接下来必须在硬件上找回场子,以证明其依然具备定义行业边界的能力。…...
2026-09-20 来源: 浏览: 次
今年的总台春晚上,人形机器人的精彩表演令人印象深刻,多家国际媒体也惊叹中国在人形机器人以及人工智能领域的飞速发展。 法国24新闻台报道说,机器人在今年的中国春晚上抢尽风头,人形机器人的功夫表演是今年春晚的一…...
2026-09-20 来源: 浏览: 次