LLM Value Index · 甲维斯机出品

大模型性价比推荐榜

规则只有一句话:在智能分够用(≥ 50)的模型里,看每花一美元能买到多少智能。 成本不是纸面单价,而是各模型跑完同一套智能测试的实测账单——话痨模型多烧的思考 token,都算在它自己头上。

数据源 Artificial Analysis 智能指数 v— 数据日期 入围 个模型
总榜 RANKING

性价比分 = 智能指数 ÷ 单任务成本(美元)。同一模型多个推理档位,只取入围档位中性价比最高的一档。

#模型智能指数单任务成本 输入/输出 $·1M性价比分
智能 × 成本全景 PARETO MAP

横轴为单任务成本(对数刻度,越左越便宜),纵轴为智能指数。左上方为理想区;金线为帕累托前沿——线上的模型,没有任何对手能同时做到「更聪明且更便宜」。

规则与口径 METHODOLOGY
01

智能分怎么来

取 Artificial Analysis 智能指数——由 GPQA Diamond、Terminal-Bench、SciCode、Humanity's Last Exam 等十项基准加权合成,业界通用的「综合智商」口径。

02

成本怎么算

不看纸面单价,看实测账单:每个模型跑完整套智能测试实际消耗的 token 按官方 API 价格计费,再除以任务数。输出越啰嗦,成本越高。

03

为什么设 50 分门槛

低于 50 分的模型再便宜也不入总榜——性价比的前提是「能用」。门槛线约为当前旗舰水平的八成。

04

档位怎么取

同一模型的不同推理力度(low / high / max…)视为不同商品,在够到门槛的档位里取性价比最高的一档上榜,档位名标注在模型名旁。