标签 | AI研究
共计3篇博客

Agent跑16步成功率跌至0%!微软LinkedIn三篇论文揭「记忆」致命缺陷,benchmark全在骗人?
三篇来自微软、LinkedIn和独立研究者的论文同时指向同一个结论:Agent最大的瓶颈不是推理能力,而是记忆系统从根上就没做对。短期记忆几何衰减、模型升级导致记忆失效、配置文件只增不减——三份诊断书揭示了同一个架构缺陷。
#Agent- AI Agent
- AI
- Agent 工程化
- +2

同一道题换个说法,模型分数能差74.7个百分点——我们用来衡量AI的尺子,本身就是歪的
IBM BenchDrift论文发现:在同一道数学题、同一个正确答案的前提下,仅仅因为题目的措辞不同,大语言模型的准确率波动幅度平均是74.7个百分点。排行榜第一名可能只是碰巧没被这套措辞难住的幸运儿。
#AI 工具- AI
- Benchmark
- AI研究

AI做不了真正的研究,普林斯顿用「影子评估」证明了这件事
普林斯顿团队用影子评估方法证明,AI agent虽然执行力惊人,但完全缺乏研究所需的判断力、品味和回撤能力。距离Altman的AI研究实习生deadline还剩25天,答案是还没有。
- AI
- AI研究
- 论文