基于全站真实运行的实测事实(成功率/延迟)+ 官方公开报价。排名不含任何平台收益因素(CI 断言强制 · 时间衰减 30 天 · 来源分级权重,近期真实回流主导)。
同名模型不同版本可能表现不同,优先用明确 modelVersion 复核。
样本少只建议试跑;有效样本和来源权重比普通调用量更重要。
有回归告警时先锁版本、换模型,或等待 Adapter 修复。
对应模型可直达失败库和 Adapter,判断是否已有修复经验。
方法论:逐条报告按时间指数衰减(半衰期 30 天)× 来源权重(verified/benchmark=1 · 社区=0.5 · 在线=0.3)加权。 质量 = 0.7×成功率 + 0.3×格式率。成本效率 = 质量 ÷ 官方价,排名不使用平台估算价。 平台估算价仅用于提示履约成本;若高于官方价则标记“官方价更低”,用户可绑定自有模型网关。