当 AI 看起来无所不能
AI 已经能写代码、解数学题、生成影像,也开始进入医院和实验室。它究竟是在全面取代人,还是只在少数任务上格外擅长?斯坦福以人为本人工智能研究院的《AI Index Report 2026》把今年最醒目的矛盾写得很清楚:模型能力快速前进,治理、评估、教育和数据体系却越来越跟不上。
这份指数横跨研发、性能、经济、科学、医学、教育、治理和公众舆论。读完后留下的印象,不是 AI 在匀速变强,而是几件事同时发生:能力跃升、真实效用出现、测量工具失准、社会准备不足。
聪明得惊人,也会错得离谱
最容易误导人的,是“参差不齐的智能边界”。同一个系统,可以在某些难题上像专家,在另一些看似简单的任务上失手。Gemini Deep Think 能在国际数学奥林匹克中达到金牌水平,读取传统模拟时钟的准确率却只有 50.1%,人类约为 90.1%。一次亮眼成绩,说明不了它已经具备稳定、通用的理解力。
更麻烦的是,用来打分的尺子本身也可能不准。部分传统测试题错误率最高可达 42%,排行榜还可能被训练数据污染和针对性刷榜扭曲。模型分数越来越接近,最多说明竞争在加剧,并不能单独证明各家系统在真实场景里同样可靠。
供给端也在向少数玩家集中。2025 年发布的 102 个知名模型里,93 个来自工业界,约占 91.2%,学术界只贡献了 2 个;大量模型也没有公开训练代码。算力和资本决定谁能训练下一代系统,外部研究者要独立核验,只会越来越难。
AI 对工作的影响并不均衡
经济账本同样冷热不均。生成式 AI 在美国一年创造的消费者剩余约 1720 亿美元——也就是用户觉得“这工具值得继续用”的额外价值。很多人已经从聊天、写作和检索里感到方便,但这不等于企业利润同步上涨,更不等于每个行业都吃到了同样红利。
效率提升最明显的地方,往往是任务边界清楚、结果容易验收的岗位。客户服务和软件开发等场景里,AI 带来约 14% 至 26% 的生产力提升。证据更支持“帮人完成一段工作”,还谈不上改写所有职业的完整流程。
就业影响也按资历分层。22 至 25 岁年轻软件开发者的就业人数,相比 2024 年下降近 20%;资深开发者的情况更稳。初级岗位承压值得警惕,但利率、科技业裁员周期和招聘收缩也可能掺在里面。现有数据还拆不开:这 20% 里,究竟有多少真是 AI 造成的。
医疗与科研中的流程应用
医疗里更站得住的用法,是让 AI 先接手记录、整理和预警,而不是独立替医生下诊断。多家机构已部署“环境 AI”语音病历工具,记录时间最多可减少 83%,投资回报率可达 112%。这些数字证明的是具体工作流变快了,不能外推成 AI 已经能独立处理复杂医疗决定。
科研侧的边界也差不多。AI 可以协助提出假设、处理资料、设计实验;但在 PaperArena 这类要求读文献、调工具并完成端到端研究的测试中,最佳 AI 智能体准确率只有 38.8%,人类博士专家为 83.5%。更贴切的角色仍是协作者,而不是能稳定接管完整科研过程的自主科学家。
技术进展快于社会准备
能力往前跑,规则和评估却在后面追。模型在标准安全测试里可能表现不错,一旦遇到蓄意绕过限制的攻击,防线又会迅速失守;加强隐私保护,还可能和准确性、公平性互相拉扯。装机量变多,并不自动等于风险可控。
公众感受也和专家预期脱节。皮尤调查显示,73% 的 AI 专家认为 AI 会改善人们的工作方式,普通公众里只有 23% 同意,相差 50 个百分点。做系统和做研究的人更容易看到效率,直面岗位变化的人更容易感到不确定。
所谓“全球图景”也仍有大片空白。部分企业调查没有纳入中国,国际教育数据缺少中国、印度和许多非洲国家,GitHub 也覆盖不了其他代码平台。这份指数适合勾勒大趋势,不能当成每个国家、每个行业、每个家庭的共同经历。
先改任务,再谈职业
更稳妥的读法是:AI 正在先改写工作中的具体步骤——整理、生成、检索和部分分析变快了,医疗与科研里的辅助流程也开始见到收益;而需要长期规划、现实验证、责任承担和复杂协作的完整工作,现有系统仍明显落后于人类。
能力、采用和资本投入在同步加速,生产力证据、就业归因、评估可靠性和治理准备却仍不齐。它能告诉我们哪些任务已经受到冲击,却给不出某个人明年是否失业、某家公司一定省多少钱的答案。
来源机构:Stanford Institute for Human-Centered Artificial Intelligence
本内容用于研究报告阅读与理解,不构成投资建议或交易信号。
在 App 深度阅读研报
精选全球权威机构研报,结构化多语言阅读,支持可信溯源。
本内容用于研究报告阅读与理解,不构成投资建议或交易信号。