规则只有一句话:在智能分够用(≥ 50)的模型里,看每花一美元能买到多少智能。 成本不是纸面单价,而是各模型跑完同一套智能测试的实测账单——话痨模型多烧的思考 token,都算在它自己头上。
性价比分 = 智能指数 ÷ 单任务成本(美元)。同一模型多个推理档位,只取入围档位中性价比最高的一档。
| # | 模型 | 智能指数 | 性价比分 |
|---|
横轴为单任务成本(对数刻度,越左越便宜),纵轴为智能指数。左上方为理想区;金线为帕累托前沿——线上的模型,没有任何对手能同时做到「更聪明且更便宜」。
取 Artificial Analysis 智能指数——由 GPQA Diamond、Terminal-Bench、SciCode、Humanity's Last Exam 等十项基准加权合成,业界通用的「综合智商」口径。
不看纸面单价,看实测账单:每个模型跑完整套智能测试实际消耗的 token 按官方 API 价格计费,再除以任务数。输出越啰嗦,成本越高。
低于 50 分的模型再便宜也不入总榜——性价比的前提是「能用」。门槛线约为当前旗舰水平的八成。
同一模型的不同推理力度(low / high / max…)视为不同商品,在够到门槛的档位里取性价比最高的一档上榜,档位名标注在模型名旁。