17 款主流大模型横评 + 一套可复用的成本测算工具。全程不写代码,7 步做完,附全部 Prompt。

一、先说结论:17 款大模型横评,价差高达 118 倍

先上横评结果。我覆盖了 8 家厂商、17 个模型,按四个典型场景实测成本:

场景最省方案月成本最贵方案月成本价差
① 日常对话问答Qwen3.8-Flash21.5 元2362 元109.9 倍
② 长文档摘要GPT-6 Luna40.5 元4049 元100.0 倍
③ 代码生成/AgentQwen3.8-Flash75.2 元8098 元107.7 倍
④ 批量内容生成Qwen3.8-Flash194 元22946 元118.3 倍
核心结论:同样一个任务,选错模型贵 100 倍以上。选型比砍价重要得多。
完整横评数据(单位:每百万 tokens):
厂商模型档位输入价输出价
----------------------------------
OpenAIGPT-6 Astra旗舰$10.00$50.00
OpenAIGPT-6 Sol均衡$2.00$10.00
OpenAIGPT-6 Luna轻量$0.10$0.50
AnthropicClaude Fable 5.1旗舰$10.00$50.00
AnthropicClaude Opus 5.5旗舰$4.00$20.00
AnthropicClaude Sonnet 5均衡$2.00$10.00
GoogleGemini 3.8 Flash轻量$0.75$3.75
GoogleGemini 3.1 Pro均衡$2.00$12.00
DeepSeekV4.1 Flash(空闲)轻量¥1.00¥4.00
DeepSeekV4 Pro(空闲)旗舰¥4.50¥13.50
通义千问Qwen3.8-Max旗舰¥2.00¥6.00
通义千问Qwen3.8-Flash轻量¥0.80¥2.70
字节豆包Doubao-Seed-2.1-Pro旗舰¥6.00¥30.00
月之暗面Kimi K3旗舰¥20.00¥100.00
智谱GLMGLM-5.3旗舰¥8.00¥28.00
智谱GLMGLM-5.3-Flash轻量¥0.80¥2.80
智谱GLMGLM-5.3-FlashX均衡¥2.00¥7.00
数据说明:价格更新于 2026-09-23,汇率按 1 USD = 6.7487 CNY 折算。以各厂商官网/官方公告为准,二手来源仅供参考。

二、行情背景:2026 年出现罕见反转

2026 年的大模型市场,出现了一个反常识的现象

国产模型集体涨价,海外模型集体降价。
据机构统计,国内八大厂商 2026 年 Q2 平均 API 输入价 4.9 元/百万 token、输出价 21.9 元/百万 token,相比 2025 年 Q1 的 3.3 元和 12.2 元,分别上涨 48% 和 80%
而海外厂商则在降价抢市场:

  • 2026-07-30 OpenAI:GPT-5.6 Luna 降价 80%
  • 2026-08-10 Anthropic:Claude Sonnet 5 的 2/2/10 首发优惠转为永久价
  • 2026-08-21 OpenAI:GPT-5.6 Sol 下调超 20%
  • 2026-09-23 OpenAI:发布 GPT-6 Sol(2/2/10)与 Luna(0.10/0.10/0.50),较上代降 50% 以上
  • 2026-09-23 Anthropic:发布 Claude Opus 5.5(4/4/20),较 Opus 5 降 20%
    行情变得这么快,手动查价格表根本跟不上。 这就是为什么需要一个能自动更新的工具。

三、技术方案:用 AiPy 零代码搭建

3.1 为什么选 AiPy

我是基于本地安全,还有成本的考虑,选择的AiPy,你们可以根据习惯自己选择工具复现,不影响。简单来说,它是一个支持自然语言驱动的 AI 智能体开发平台。可以:

  1. 支持联网检索:价格数据必须实时查,AiPy 能自己拆成多轮搜索
  2. 支持零代码开发:全程说人话,不用写一行代码
  3. 支持打包成智能体:做完能直接装到本地,点开就用

3.2 工具架构

最终做出来的工具包含 4 个功能区:

功能区技术实现
📋 价格总览内置结构化价格数据(JSON),前端三维筛选 + 汇率实时折算
📉 价格动态时间线组件,按降价/涨价/调价分类着色
🧮 成本计算器前端实时计算,按公式排序,支持 CSV 导出
💡 选型与省钱静态配置 + AI 动态生成
外加一个杀手锏:AI 智能预估——用大白话描述任务,AI 自动拆解需求、预估 token、推荐模型。

四、保姆级步骤拆解(7 步)

第 1 步:让 AiPy 去查价格

目标:拿到带来源和日期的结构化价格数据。
Prompt(直接复制):

帮我查一下现在主流大模型 API 的最新价格,包括 OpenAI、Claude、Gemini,
还有国产的 DeepSeek、通义千问、豆包、Kimi、智谱,要输入价、输出价、
上下文长度,还要标注来源和日期。

三个关键点

  1. 划定范围——明确要哪些厂商
  2. 指定字段——输入价、输出价、上下文长度
  3. 要求可核实——必须标注来源和日期,避免 AI 编造数据
    ⚠️ 避坑:如果 AiPy 返回的价格没有来源,一定要追问"每个价格的来源和日期是什么?"。价格数据必须可核实。

第 2 步:让它算成本

Prompt

按四个典型场景算成本:
① 日常对话问答(输入 1K/输出 0.5K/月 1 万次)
② 长文档摘要(输入 50K/输出 2K/月 1 千次)
③ 代码生成 Agent(输入 20K/输出 8K/月 2 千次)
④ 批量内容生成(输入 2K/输出 3K/月 2 万次)
每个场景给我完整的排名表,标出最省、最贵、价差倍数和可节省金额。

计算口径

单次成本 = 输入token数 ÷ 1,000,000 × 输入单价 + 输出token数 ÷ 1,000,000 × 输出单价
月成本   = 单次成本 × 月调用次数

国际模型按汇率折算成人民币(本文按 1 USD = 6.7487 CNY)。

第 3 步:让它做成工具

Prompt

把这个做成一个带界面的智能体,我要能点开就用。
要有价格总览表、价格动态时间线、成本计算器、选型建议四个部分。

AiPy 会自己把前后端全写好,包括界面、服务、数据文件,还会自动安装。这一步大约 3 分钟。

第 4 步:进阶——让它"听懂人话"

背景:工具做出来后我发现一个问题——我自己懂 token 是什么,但同事不懂啊。
Prompt

在成本计算器部分,给用户提供一个输入框,用户可以手动输入他的任务需求,
agent 通过分析任务难度、拆解需求和动作,自动预估需要的 tokens,
预估价格,然后给出选型建议。

AiPy 在后台生成的"灵魂提示词"(完整贴出):

你是一位资深 AI 应用架构师。用户会描述一个他想用大模型完成的任务,
请你分析并预估 token 消耗。
1. 判定任务难度:简单 / 中等 / 复杂
   · 简单:分类、抽取、翻译、简单问答、格式化
   · 中等:写作、常规代码生成、知识问答、内容总结
   · 复杂:架构设计、多步推理、长链路 Agent、高价值决策分析
2. 把任务拆解成 2-5 个具体动作步骤,每个步骤说明大致要处理多少内容
3. 预估「单次任务」的输入 token 和输出 token(必须给出具体数字)
   · 参考基准:一句话问答约 1000 输入/500 输出;
     一篇 3000 字文档约 5000 输入;一份 50 页报告约 50000 输入
   · 输出 token 通常明显少于输入(除非是生成类任务)
4. 预估合理的「每月调用次数」(根据任务性质判断,
   比如客服机器人可能上万次,写报告可能几十次)
5. 给出选型建议:推荐 2-3 个模型(从轻量/均衡/旗舰中选),说明理由
【输出格式】必须严格返回 JSON,不要有任何其他文字、
不要用 markdown 代码块包裹:
{
  "difficulty": "简单|中等|复杂",
  "difficultyReason": "一句话说明为什么是这个难度",
  "steps": [{"name": "步骤名称", "detail": "这步做什么,大概处理多少内容"}],
  "inputTokens": 数字,
  "outputTokens": 数字,
  "monthlyCalls": 数字,
  "callsReason": "为什么预估这个调用次数",
  "recommendation": [{"tier": "轻量|均衡|旗舰", "model": "模型名", "reason": "推荐理由"}],
  "savingTip": "一条针对该任务的省钱建议"
}

三个设计巧思

巧思说明
给了参考基准"3000 字文档约 5000 输入",让 AI 有锚点
强制返回 JSON程序才能解析,不会返回废话
明确禁止代码块包裹踩过坑才知道,AI 特别爱加 ```json
实测效果
输入"我想做一个客服机器人,每天回复客户关于产品退换货的问题,每次回答大概 200 字,每天约 300 个用户咨询",AiPy 返回:
  • 任务难度:简单(基于固定知识库的常规问答,无需复杂推理)
  • 需求拆解:① 意图识别与上下文提取 ② 策略匹配与内容生成
  • Token 预估:单次输入 150、输出 400,月调用 9000 次
  • 选型建议:推荐 3 个模型,分轻量/均衡/旗舰三档
  • 省钱提示:把退换货政策预设为 System Prompt,可显著减少输入 token
    点「带入成本计算器」→ 最省 10.8 元/月,最贵 1305.87 元/月,差 120.9 倍

第 5 步:避坑指南(3 个实战坑)

坑 1:AI 返回带代码块包裹,JSON 解析失败

现象:提示词里说了"不要包裹",但 AI 有时还是会加 json。 **解决**:代码里做容错——先去掉首尾的  标记,再截取第一个 { 到最后一个 } 之间的内容。

坑 2:AI 预估的数字偶尔离谱

现象:把月调用次数估成 0 或负数。
解决:加字段校验和兜底。数字不合法就用默认值(输入 2000、输出 1000、月调用 1000)。

坑 3:中文引号导致代码报错

现象:生成报告时文案里有中文引号,直接把字符串搞崩。
解决:生成内容统一用英文引号,或做好转义。

第 6 步:4 处微调

微调解决什么问题
加"带入成本计算器"按钮预估完 token 一键填入,不用手动抄
加实时联动改输入框,排名表立刻刷新
加 CSV 导出算完能导出给财务
加深色模式自适应跟随主题自动切换

第 7 步:部署与使用

AiPy 会自动把智能体装到本地扩展目录,重启客户端后即可在智能体集市中找到。价格变了改一下数据文件就能更新。

五、省钱建议(8 条)

  1. 按难度分层用模型——简单用轻量、中等用均衡、复杂用旗舰。把 80% 简单请求从旗舰切到轻量,账单降 70%~90%
  2. 中文任务优先国产模型——Qwen3.8-Flash 比 Claude Sonnet 5 便宜约 17~25 倍
  3. 用好缓存命中——DeepSeek 缓存命中 0.02 元/百万 token,是未命中价的 1/50;Kimi K3 缓存命中是未命中的 1/10;Claude Opus 5.5 缓存读比标准输入便宜 95%
  4. 利用峰谷时段——DeepSeek 空闲时段价格仅为高峰的 50%,周末全天按空闲价
  5. 使用批量接口——Kimi Batch 为标准价 60%,Anthropic Batch 最高省 50%,OpenAI Batch 为标准价 50%
  6. 长文档先摘要再喂贵模型——可省 80% 以上
  7. 严格控制输出长度——输出单价通常是输入的 3~5 倍
  8. 警惕优惠到期——Gemini 3.8 Flash 现价是促销价,2027-01-01 起翻倍

六、选型速查表

你的需求推荐模型理由
日常客服/问答机器人Qwen3.8-Flash月成本仅 21.5 元,中文好
高频批量内容生成Qwen3.8-Flash / GLM-5.3-Flash单价最低,输出便宜
长文档摘要/信息抽取GPT-6 Luna长输入场景全球最省
中等难度代码生成GPT-6 Sol / Claude Sonnet 5能力与成本平衡点
复杂 Agent / 多步推理Claude Opus 5.5能力强,缓存读便宜 95%
最难的科研/高价值决策GPT-6 Astra能力天花板,但很贵
超长上下文(百万级)Qwen3.8-Max / Kimi K31M 上下文,国产更划算
预算极紧的初创团队DeepSeek V4.1 Flash闲时 1元/4元,周末更省
需要极快响应速度GLM-5.3-FlashX200 tokens/s,速度优先

七、选型还要考虑什么

价格只是决策的一部分,别只盯单价。

  1. 能力上限——便宜模型在复杂推理、长链路 Agent 上可能反复失败,重试多了实际成本反而更高。要算"完成一个任务的总成本"
  2. 稳定性与限流——部分低价模型高峰期会限流
  3. 合规与数据安全——涉及隐私、金融、医疗数据,需确认数据不出境、是否支持私有化部署
  4. 延迟(首 token 时间)——实时对话场景速度可能比价格更重要
  5. 生态与工具支持——是否支持 Function Calling、结构化输出、MCP 协议
  6. 供应商风险——价格战期间厂商可能随时调价(DeepSeek 一个月内两次调价),建议做好多模型路由预案

八、总结

整个教程 7 个步骤,全程没写一行代码,用 AiPy 把需求用大白话讲清楚就行。
关键 Prompt 回顾

步骤Prompt 核心
第 1 步查价格——划定范围 + 指定字段 + 要求可核实
第 2 步算成本——说清场景参数 + 明确对比维度
第 3 步做工具——说清功能模块
第 4 步听懂人话——说清要 AI 干的四件事
回头看,最关键的其实是把需求说清楚。说得越具体,AiPy 做得越准。
如果你也在为 AI 成本头疼,或者想知道自己那个任务该用哪个模型,真心建议试试。毕竟选对模型,一年能省好几万

数据说明:本文价格数据更新于 2026-09-23,汇率按 1 USD = 6.7487 CNY 折算。价格以各厂商官网/官方公告为准,实际账单还受缓存命中、峰谷时段、长上下文加价、批量折扣影响,本文按标准价口径测算,属保守估算。

Logo

一站式 AI 云服务平台

更多推荐