先说核心建议吧: Anthropic 官方建议你从最强的通用模型开始试,然后根据实际情况往下调整。为什么?因为往往来说,一个更聪明的模型虽然单价更贵,但由于它更少出错、更少需要反复调整,最终的单任务成本反而更低。反过来,如果你上来就选一个便宜模型,最后可能要花更多时间调试,到底是模型不行还是你的设置有问题都说不清楚。
Claude 模型家族详解
Mythos / Fable:Anthropic 最强的两个版本
Mythos 是 Anthropic 的最具能力的模型类别,在各个领域都具有前沿能力。这个模型类别在编码、长期运行的 Agent 任务以及解决 AI 之前不能可靠处理的问题方面特别出色。
Mythos 类别以两个版本的形式发布,使用相同的底层模型。Claude Mythos 是为处理双用途网络安全和生物学工作的可信组织提供的,而 Claude Fable 则配备了额外的安全防护措施,使该模型可以安全地供公众使用。两者都需要有限数据保留,以便安全使用。
Opus:企业级推理任务的强大引擎
Opus 是我们为推理密集型企业任务提供的强大模型类别。Opus 模型在关键行业基准上的排名始终位居前列,例如用于知识工作的 GDPval-AA 和用于 Agent 编码的 Terminal-Bench 2.1。
Opus 和 Fable 之间的选择可能表面上看不太清楚,因为两者都在编码、长期运行的 Agent 和知识工作方面表现出色。在真实场景中,Fable 等较大的模型往往具有更多的智慧、创意和写作技能,尽管在基准分数上与 Opus 等模型相似。
一般的经验法则是:如果你的评估或内部测试显示 Opus 在某些任务上存在困难,那么 Fable 就是答案。如果 Opus 已经达到质量标准,那么它的速度和价格配置可能使其成为更好的选择。
Sonnet:日常任务的多功能模型
Sonnet 是我们用于日常任务的多功能模型类别。Sonnet 为最广泛的通用用例提供性能、成本和速度的平衡,包括多 Agent 编排设置中的高容量子 Agent。
Haiku:最低成本和最快速度的选择
Haiku 是我们成本最低、速度最快的模型类别。Haiku 模型专为延迟和成本至关重要的高频工作负载而设计。
怎样选择适合你的模型?
这里要澄清一个误解:Claude 的模型类别并不专精于某一领域。我们不会为金融推荐一个模型类别,为科学推荐另一个。每个 Claude 模型都经过训练,在编码、Agent 任务和知识工作等领域都表现出色。
模型类别之间的主要区别在于它们能可靠地处理多难的问题,以及这种能力在价格和速度方面的成本。选择模型时,问自己这些问题:
如何判断任务的难度? 如果任务通常需要花费大量时间、涉及多个步骤,或者是以前未解决的问题,那么更强大的模型类别是合适的。
延迟需求是什么? 如果模型涉及高频面向客户的工作负载,那么 Sonnet 通常是最佳选择。
访问约束是什么? Mythos 仅对 Project Glasswing 下的组织可用。并非所有组织都为所有角色提供所有模型类别。
单位经济学如何? 生产量较高的情况下可能更适合使用较低等级的模型类别,特别是如果评估显示这些任务能够令人满意地完成的话。模型按 Token 不同定价,并且根据其能力和工作量级别会有不同的单任务成本。
努力等级也会影响质量、速度和成本的平衡。更高等级的模型在更高的努力等级下提供最佳性能,而更高等级的模型在较低的努力等级下有时比较低等级的模型更高效。
玩出新花样:Advisor 策略
Advisor 策略允许更快、成本更低的 Worker 模型调用更智能的模型来检查其计划和评估其工作,从而改进性能。
这种方法中,执行者模型仅在需要时由教练指导,可以大幅改进性能。例如,在 SWE-bench Pro 上,Sonnet 5 配合 Fable 5 Advisor 的性能在 Fable 5 的 63% 成本范围内达到了 Fable 5 分数的 90% 以内。
评估和基准的作用
判断模型能力是否足以满足你的需求,有两种常见方法:使用标准基准和自定义评估。
基准是一组预先确定的任务或场景,通常针对特定领域,具有已知的解决方案。这些可以作为跨模型类别和供应商评估能力的有用方向指南。但当评估功能强大的模型(如 Opus 和 Fable)时,这些模型几乎可以解决测试上的所有问题(通常称为饱和),问题就出现了。
在这些情况下,我们建议组织在真实工作负载上使用这些模型或用自己的评估来做出决定。通常,评估是从生产中精选的一组问题——包括你当前工具不足的困难任务,以及你的团队定义的成功标准。这是前沿模型的能力和创意开始从其他模型中脱颖而出的地方。
最后的建议
没有一种模型适合所有场景,这就是为什么 Anthropic 提供多个模型类别。最终,选择模型的最佳方法是理解每个模型类别的基础知识并深入理解你的用例。这意味着构建、维护和部署强大的评估。