Anthropic 发布 Claude 4.5 系列,重点强化了智能体场景下的长任务能力。官方数据显示,模型可以连续自主编程 30 小时而不出现明显的能力衰减,较上代的 7 小时提升超过四倍。
检查点与上下文管理
新引入的检查点机制允许智能体在长任务中定期保存中间状态,即便上下文窗口被压缩,也能从最近的检查点恢复工作。Anthropic 将其类比为”游戏存档”。
在内部评测中,Claude 4.5 完成了包括重构大型代码库、跨仓库迁移在内的多个数天级任务,人工干预次数中位数仅为 2 次。
竞争格局
面对 OpenAI 与 Google 在智能体方向的夹击,Anthropic 选择了”垂直打穿”的策略:先在编程这一高价值场景建立不可替代性,再向通用智能体扩展。