小白保姆级教程:零代码搭建【AI价格监控、成本预估和对比小助手】(附步骤拆解和Prompt)
17 款主流大模型横评 + 一套可复用的成本测算工具。全程不写代码,7 步做完,附全部 Prompt。
一、先说结论:17 款大模型横评,价差高达 118 倍
先上横评结果。我覆盖了 8 家厂商、17 个模型,按四个典型场景实测成本:
| 场景 | 最省方案 | 月成本 | 最贵方案月成本 | 价差 |
|---|---|---|---|---|
| ① 日常对话问答 | Qwen3.8-Flash | 21.5 元 | 2362 元 | 109.9 倍 |
| ② 长文档摘要 | GPT-6 Luna | 40.5 元 | 4049 元 | 100.0 倍 |
| ③ 代码生成/Agent | Qwen3.8-Flash | 75.2 元 | 8098 元 | 107.7 倍 |
| ④ 批量内容生成 | Qwen3.8-Flash | 194 元 | 22946 元 | 118.3 倍 |
| 核心结论:同样一个任务,选错模型贵 100 倍以上。选型比砍价重要得多。 | ||||
| 完整横评数据(单位:每百万 tokens): | ||||
| 厂商 | 模型 | 档位 | 输入价 | 输出价 |
| ------ | ------ | ------ | -------- | -------- |
| OpenAI | GPT-6 Astra | 旗舰 | $10.00 | $50.00 |
| OpenAI | GPT-6 Sol | 均衡 | $2.00 | $10.00 |
| OpenAI | GPT-6 Luna | 轻量 | $0.10 | $0.50 |
| Anthropic | Claude Fable 5.1 | 旗舰 | $10.00 | $50.00 |
| Anthropic | Claude Opus 5.5 | 旗舰 | $4.00 | $20.00 |
| Anthropic | Claude Sonnet 5 | 均衡 | $2.00 | $10.00 |
| Gemini 3.8 Flash | 轻量 | $0.75 | $3.75 | |
| Gemini 3.1 Pro | 均衡 | $2.00 | $12.00 | |
| DeepSeek | V4.1 Flash(空闲) | 轻量 | ¥1.00 | ¥4.00 |
| DeepSeek | V4 Pro(空闲) | 旗舰 | ¥4.50 | ¥13.50 |
| 通义千问 | Qwen3.8-Max | 旗舰 | ¥2.00 | ¥6.00 |
| 通义千问 | Qwen3.8-Flash | 轻量 | ¥0.80 | ¥2.70 |
| 字节豆包 | Doubao-Seed-2.1-Pro | 旗舰 | ¥6.00 | ¥30.00 |
| 月之暗面 | Kimi K3 | 旗舰 | ¥20.00 | ¥100.00 |
| 智谱GLM | GLM-5.3 | 旗舰 | ¥8.00 | ¥28.00 |
| 智谱GLM | GLM-5.3-Flash | 轻量 | ¥0.80 | ¥2.80 |
| 智谱GLM | GLM-5.3-FlashX | 均衡 | ¥2.00 | ¥7.00 |
| 数据说明:价格更新于 2026-09-23,汇率按 1 USD = 6.7487 CNY 折算。以各厂商官网/官方公告为准,二手来源仅供参考。 |
二、行情背景:2026 年出现罕见反转
2026 年的大模型市场,出现了一个反常识的现象:
国产模型集体涨价,海外模型集体降价。
据机构统计,国内八大厂商 2026 年 Q2 平均 API 输入价 4.9 元/百万 token、输出价 21.9 元/百万 token,相比 2025 年 Q1 的 3.3 元和 12.2 元,分别上涨 48% 和 80%。
而海外厂商则在降价抢市场:
- 2026-07-30 OpenAI:GPT-5.6 Luna 降价 80%
- 2026-08-10 Anthropic:Claude Sonnet 5 的 2/2/10 首发优惠转为永久价
- 2026-08-21 OpenAI:GPT-5.6 Sol 下调超 20%
- 2026-09-23 OpenAI:发布 GPT-6 Sol(2/2/10)与 Luna(0.10/0.10/0.50),较上代降 50% 以上
- 2026-09-23 Anthropic:发布 Claude Opus 5.5(4/4/20),较 Opus 5 降 20%
行情变得这么快,手动查价格表根本跟不上。 这就是为什么需要一个能自动更新的工具。
三、技术方案:用 AiPy 零代码搭建
3.1 为什么选 AiPy
我是基于本地安全,还有成本的考虑,选择的AiPy,你们可以根据习惯自己选择工具复现,不影响。简单来说,它是一个支持自然语言驱动的 AI 智能体开发平台。可以:
- 支持联网检索:价格数据必须实时查,AiPy 能自己拆成多轮搜索
- 支持零代码开发:全程说人话,不用写一行代码
- 支持打包成智能体:做完能直接装到本地,点开就用
3.2 工具架构

最终做出来的工具包含 4 个功能区:
| 功能区 | 技术实现 |
|---|---|
| 📋 价格总览 | 内置结构化价格数据(JSON),前端三维筛选 + 汇率实时折算 |
| 📉 价格动态 | 时间线组件,按降价/涨价/调价分类着色 |
| 🧮 成本计算器 | 前端实时计算,按公式排序,支持 CSV 导出 |
| 💡 选型与省钱 | 静态配置 + AI 动态生成 |
| 外加一个杀手锏:AI 智能预估——用大白话描述任务,AI 自动拆解需求、预估 token、推荐模型。 |
四、保姆级步骤拆解(7 步)
第 1 步:让 AiPy 去查价格
目标:拿到带来源和日期的结构化价格数据。
Prompt(直接复制):
帮我查一下现在主流大模型 API 的最新价格,包括 OpenAI、Claude、Gemini,
还有国产的 DeepSeek、通义千问、豆包、Kimi、智谱,要输入价、输出价、
上下文长度,还要标注来源和日期。
三个关键点:
- 划定范围——明确要哪些厂商
- 指定字段——输入价、输出价、上下文长度
- 要求可核实——必须标注来源和日期,避免 AI 编造数据
⚠️ 避坑:如果 AiPy 返回的价格没有来源,一定要追问"每个价格的来源和日期是什么?"。价格数据必须可核实。
第 2 步:让它算成本
Prompt:
按四个典型场景算成本:
① 日常对话问答(输入 1K/输出 0.5K/月 1 万次)
② 长文档摘要(输入 50K/输出 2K/月 1 千次)
③ 代码生成 Agent(输入 20K/输出 8K/月 2 千次)
④ 批量内容生成(输入 2K/输出 3K/月 2 万次)
每个场景给我完整的排名表,标出最省、最贵、价差倍数和可节省金额。
计算口径:
单次成本 = 输入token数 ÷ 1,000,000 × 输入单价 + 输出token数 ÷ 1,000,000 × 输出单价
月成本 = 单次成本 × 月调用次数
国际模型按汇率折算成人民币(本文按 1 USD = 6.7487 CNY)。
第 3 步:让它做成工具
Prompt:
把这个做成一个带界面的智能体,我要能点开就用。
要有价格总览表、价格动态时间线、成本计算器、选型建议四个部分。
AiPy 会自己把前后端全写好,包括界面、服务、数据文件,还会自动安装。这一步大约 3 分钟。
第 4 步:进阶——让它"听懂人话"
背景:工具做出来后我发现一个问题——我自己懂 token 是什么,但同事不懂啊。
Prompt:
在成本计算器部分,给用户提供一个输入框,用户可以手动输入他的任务需求,
agent 通过分析任务难度、拆解需求和动作,自动预估需要的 tokens,
预估价格,然后给出选型建议。
AiPy 在后台生成的"灵魂提示词"(完整贴出):
你是一位资深 AI 应用架构师。用户会描述一个他想用大模型完成的任务,
请你分析并预估 token 消耗。
1. 判定任务难度:简单 / 中等 / 复杂
· 简单:分类、抽取、翻译、简单问答、格式化
· 中等:写作、常规代码生成、知识问答、内容总结
· 复杂:架构设计、多步推理、长链路 Agent、高价值决策分析
2. 把任务拆解成 2-5 个具体动作步骤,每个步骤说明大致要处理多少内容
3. 预估「单次任务」的输入 token 和输出 token(必须给出具体数字)
· 参考基准:一句话问答约 1000 输入/500 输出;
一篇 3000 字文档约 5000 输入;一份 50 页报告约 50000 输入
· 输出 token 通常明显少于输入(除非是生成类任务)
4. 预估合理的「每月调用次数」(根据任务性质判断,
比如客服机器人可能上万次,写报告可能几十次)
5. 给出选型建议:推荐 2-3 个模型(从轻量/均衡/旗舰中选),说明理由
【输出格式】必须严格返回 JSON,不要有任何其他文字、
不要用 markdown 代码块包裹:
{
"difficulty": "简单|中等|复杂",
"difficultyReason": "一句话说明为什么是这个难度",
"steps": [{"name": "步骤名称", "detail": "这步做什么,大概处理多少内容"}],
"inputTokens": 数字,
"outputTokens": 数字,
"monthlyCalls": 数字,
"callsReason": "为什么预估这个调用次数",
"recommendation": [{"tier": "轻量|均衡|旗舰", "model": "模型名", "reason": "推荐理由"}],
"savingTip": "一条针对该任务的省钱建议"
}
三个设计巧思:
| 巧思 | 说明 |
|---|---|
| 给了参考基准 | "3000 字文档约 5000 输入",让 AI 有锚点 |
| 强制返回 JSON | 程序才能解析,不会返回废话 |
| 明确禁止代码块包裹 | 踩过坑才知道,AI 特别爱加 ```json |
| 实测效果: | |
| 输入"我想做一个客服机器人,每天回复客户关于产品退换货的问题,每次回答大概 200 字,每天约 300 个用户咨询",AiPy 返回: |
- 任务难度:简单(基于固定知识库的常规问答,无需复杂推理)
- 需求拆解:① 意图识别与上下文提取 ② 策略匹配与内容生成
- Token 预估:单次输入 150、输出 400,月调用 9000 次
- 选型建议:推荐 3 个模型,分轻量/均衡/旗舰三档
- 省钱提示:把退换货政策预设为 System Prompt,可显著减少输入 token
点「带入成本计算器」→ 最省 10.8 元/月,最贵 1305.87 元/月,差 120.9 倍。
第 5 步:避坑指南(3 个实战坑)
坑 1:AI 返回带代码块包裹,JSON 解析失败
现象:提示词里说了"不要包裹",但 AI 有时还是会加 json。 **解决**:代码里做容错——先去掉首尾的 标记,再截取第一个 { 到最后一个 } 之间的内容。
坑 2:AI 预估的数字偶尔离谱
现象:把月调用次数估成 0 或负数。
解决:加字段校验和兜底。数字不合法就用默认值(输入 2000、输出 1000、月调用 1000)。
坑 3:中文引号导致代码报错
现象:生成报告时文案里有中文引号,直接把字符串搞崩。
解决:生成内容统一用英文引号,或做好转义。
第 6 步:4 处微调
| 微调 | 解决什么问题 |
|---|---|
| 加"带入成本计算器"按钮 | 预估完 token 一键填入,不用手动抄 |
| 加实时联动 | 改输入框,排名表立刻刷新 |
| 加 CSV 导出 | 算完能导出给财务 |
| 加深色模式自适应 | 跟随主题自动切换 |
第 7 步:部署与使用
AiPy 会自动把智能体装到本地扩展目录,重启客户端后即可在智能体集市中找到。价格变了改一下数据文件就能更新。
五、省钱建议(8 条)
- 按难度分层用模型——简单用轻量、中等用均衡、复杂用旗舰。把 80% 简单请求从旗舰切到轻量,账单降 70%~90%
- 中文任务优先国产模型——Qwen3.8-Flash 比 Claude Sonnet 5 便宜约 17~25 倍
- 用好缓存命中——DeepSeek 缓存命中 0.02 元/百万 token,是未命中价的 1/50;Kimi K3 缓存命中是未命中的 1/10;Claude Opus 5.5 缓存读比标准输入便宜 95%
- 利用峰谷时段——DeepSeek 空闲时段价格仅为高峰的 50%,周末全天按空闲价
- 使用批量接口——Kimi Batch 为标准价 60%,Anthropic Batch 最高省 50%,OpenAI Batch 为标准价 50%
- 长文档先摘要再喂贵模型——可省 80% 以上
- 严格控制输出长度——输出单价通常是输入的 3~5 倍
- 警惕优惠到期——Gemini 3.8 Flash 现价是促销价,2027-01-01 起翻倍
六、选型速查表
| 你的需求 | 推荐模型 | 理由 |
|---|---|---|
| 日常客服/问答机器人 | Qwen3.8-Flash | 月成本仅 21.5 元,中文好 |
| 高频批量内容生成 | Qwen3.8-Flash / GLM-5.3-Flash | 单价最低,输出便宜 |
| 长文档摘要/信息抽取 | GPT-6 Luna | 长输入场景全球最省 |
| 中等难度代码生成 | GPT-6 Sol / Claude Sonnet 5 | 能力与成本平衡点 |
| 复杂 Agent / 多步推理 | Claude Opus 5.5 | 能力强,缓存读便宜 95% |
| 最难的科研/高价值决策 | GPT-6 Astra | 能力天花板,但很贵 |
| 超长上下文(百万级) | Qwen3.8-Max / Kimi K3 | 1M 上下文,国产更划算 |
| 预算极紧的初创团队 | DeepSeek V4.1 Flash | 闲时 1元/4元,周末更省 |
| 需要极快响应速度 | GLM-5.3-FlashX | 200 tokens/s,速度优先 |
七、选型还要考虑什么
价格只是决策的一部分,别只盯单价。
- 能力上限——便宜模型在复杂推理、长链路 Agent 上可能反复失败,重试多了实际成本反而更高。要算"完成一个任务的总成本"
- 稳定性与限流——部分低价模型高峰期会限流
- 合规与数据安全——涉及隐私、金融、医疗数据,需确认数据不出境、是否支持私有化部署
- 延迟(首 token 时间)——实时对话场景速度可能比价格更重要
- 生态与工具支持——是否支持 Function Calling、结构化输出、MCP 协议
- 供应商风险——价格战期间厂商可能随时调价(DeepSeek 一个月内两次调价),建议做好多模型路由预案
八、总结
整个教程 7 个步骤,全程没写一行代码,用 AiPy 把需求用大白话讲清楚就行。
关键 Prompt 回顾:
| 步骤 | Prompt 核心 |
|---|---|
| 第 1 步 | 查价格——划定范围 + 指定字段 + 要求可核实 |
| 第 2 步 | 算成本——说清场景参数 + 明确对比维度 |
| 第 3 步 | 做工具——说清功能模块 |
| 第 4 步 | 听懂人话——说清要 AI 干的四件事 |
| 回头看,最关键的其实是把需求说清楚。说得越具体,AiPy 做得越准。 | |
| 如果你也在为 AI 成本头疼,或者想知道自己那个任务该用哪个模型,真心建议试试。毕竟选对模型,一年能省好几万。 |
数据说明:本文价格数据更新于 2026-09-23,汇率按 1 USD = 6.7487 CNY 折算。价格以各厂商官网/官方公告为准,实际账单还受缓存命中、峰谷时段、长上下文加价、批量折扣影响,本文按标准价口径测算,属保守估算。
更多推荐







所有评论(0)