| # | 模型 | 智能指数 | 性价比分 |
|---|
横轴为单任务成本(对数刻度,越左越便宜),纵轴为智能指数。金线为帕累托前沿,线上的模型没有任何对手能同时做到「更聪明且更便宜」。粉色区域是斩杀区,落在里面的模型,比斩杀线上那个点又贵又笨。
性价比分 = 智能指数 ÷ 单任务成本(美元)。比如智能指数 50.1、单任务成本 $0.033,性价比分就是 50.1 ÷ 0.033 ≈ 1527。
取 Artificial Analysis 智能指数,由 GPQA Diamond、Terminal-Bench、SciCode、Humanity's Last Exam 等十项基准加权合成,业界通用的「综合智商」口径。
单任务成本是模型完成一个标准测试任务实际消耗的费用,按官方 API 价格计算,推理消耗的 token 一并计入。输出越啰嗦,成本越高。
智能指数低于 50 的模型再便宜也不参与排名,能用是性价比的前提。门槛线大约是当前旗舰水平的八成。
同一模型的不同推理力度(low / high / max…)视为不同商品,在够到门槛的档位里取性价比最高的一档上榜,档位名标注在模型名旁。