
在线配资开户官网
大多数人对AI聊天机器人的信任,建立在一次次简短问答的良好体验之上,但如果对话被不断拉长呢?
亚利桑那大学研究团队针对这个问题给出了令人不安的答案:在长时间、多轮次的对话中,包括GPT、Claude、Gemini在内的七款主流大语言模型,都暴露出了此前很少被系统评估过的错误信息漏洞。这项研究发表在《科学报告》期刊上。
一、七款主流模型的"压力测试"
研究团队评估的对象覆盖了当前最主流的一批模型:GPT-3.5、GPT-4o、GPT-4o-mini、Claude 3.5 Sonnet、Gemini 1.5 Pro、Llama-3-70B以及DeepSeek-R1。
测试聚焦三个维度:模型有多容易被反复出现的错误陈述"带偏"、有多容易被说服接受错误观点,以及被明确指出错误后能否被有效纠正。
结果显示,在包含重复虚假陈述的对话中,GPT-3.5最容易反复重申错误信息,抵抗力表现最差;相比之下,Claude 3.5 Sonnet的表现最为稳健。而在"易说服性"这一项上,DeepSeek-R1的得分最低,部分原因在于其偏好讽刺式回应,导致模型意图更难被准确解读。
二、"回响":一种此前未被命名的故障模式
研究还发现了一个所有七款模型普遍共有的规律:面对相对冷门、生僻的话题时,它们抵御错误信息的能力会明显下降。研究人员的解释是,训练数据越充分的话题,模型的"免疫力"往往也越强;反之,训练数据稀疏的冷门领域,则更容易被错误陈述牵着走。

更值得警惕的是一种被研究团队命名为"回响"的故障现象:模型会在同一场对话中,反复在"认同"与"否认"同一条虚假陈述之间来回摇摆,让人难以判断其真实立场。
这种不稳定的表现模式,此前很少在单次问答式的测试中被察觉,却恰恰是多轮次真实对话场景中最容易反复出现的情况。论文通讯作者玛文·斯莱皮安指出,这凸显出保持审慎人工参与的必要性,以及盲目依赖AI输出结果的危险。
三、当AI被用于医疗、法律:警惕不等于因噎废食
斯莱皮安特别强调,用一套"反复无常、结果难以稳定复现"的系统去支撑关键决策,本身就存在不小的风险。这一提醒对医疗、法律等高风险应用场景尤为关键,因为这些领域的用户往往会与AI进行长时间的追问与澄清式对话,而不是止步于第一轮简单回答。
值得庆幸的是,研究也发现了积极的一面:GPT-4o、GPT-4o-mini、Gemini 1.5 Pro和DeepSeek-R1在被明确二次提示纠正后,都能做到100%修正此前的错误陈述。
这意味着在线配资开户官网,问题的关键或许不在于彻底摒弃这些工具,而在于设计更完善的人工核查机制,去弥补多轮对话中暴露出的这些认知裂缝,尤其是在容错空间极小的专业场景里。
贴心配资提示:文章来自网络,不代表本站观点。