返回博客

GPT-6 Sol、Luna 与 Claude Opus 5.5:别只算 Token 单价

OpenAI, Claude and MuseWork marks in three equally sized square tiles for a model comparison article.

一份竞品周报如果需要反复补来源、重算数字,即使模型单价便宜,交付成本也未必低。9 月 22 日发布的三款模型,让团队有了新的选择;真正要比较的,是同一份工作做到可交付要花多少代价。

这次发布了什么

OpenAI 发布 GPT-6 Sol 与 Luna,前者面向更复杂的编码和多步骤任务,后者偏向明确、重复量大的工作。OpenAI 称 API 价格比 GPT-5.6 促销价低 50%;截至本文核验,Sol 每百万输入/输出 Token 分别为 2/10 美元,Luna 为 0.10/0.50 美元。Anthropic 同日发布 Claude Opus 5.5,输入/输出单价为 4/20 美元,比 Opus 5 的标价低 20%;缓存读取为每百万 Token 0.20 美元。Anthropic 所称典型负载成本降低约 40%,是其测算结果,不能当成标价再打一次折。

用一笔示例任务,把价格算明白

假设一次任务输入 10 万 Token、输出 1 万 Token,暂不计算缓存与工具调用。按 9 月 24 日核对的标准 API 价格,单次模型费用约为 Sol 0.30 美元、Luna 0.015 美元、Opus 5.5 0.60 美元。这是根据假设用量做的算术示例,并非实测结果,更不代表三款模型会交出同等质量的成品。如果 Luna 需要多次重跑,或者 Opus 减少了大量人工复核,最终成本就会改变。

另一个容易忽略的细节:OpenAI 文档显示,Sol 和 Luna 的输入超过 27.2 万 Token 时,整个请求适用更高价格,而不是只有超出部分加价;快速处理和部分地区处理也有独立计费。Anthropic 强调 Opus 5.5 的缓存读取费用下降,但只有反复使用相同背景资料的流程,才能充分受益。采购时要看自己的请求分布,而不只看模型的最大上下文和标价。

评测榜单如何放进工作场景

Artificial Analysis 在最高推理档位测得 Opus 5.5 的 Intelligence Index 为 58,发布时居其榜首。这说明它在该评测设置下表现强,但不能推导出您团队的采购简报一定完成得最好。推理档位、工具、输入资料和验收标准不同,结果也会变。能装下很长的资料,也不等于每处引用和金额都准确。

比如把三份产品说明、两份 PDF 和价格表整理成一页建议:表面上写得顺畅,却漏掉脚注里的新报价,就不能算完成。测试时最好准备三到五件真实但已脱敏的任务,给每个候选相同的资料,事先写明需要哪些章节、数字、来源和可修改格式。除了第一次生成,还要记录失败重试、修改次数和人工复核时间,最后算每份验收通过的成品需要多少成本。

让三类工作分别给出答案

多来源周报重点看事实冲突和出处;批量字段提取看每条记录的错误率、重跑率;演示文稿提纲则看建议是否有数据支撑、编辑能否直接修改。把输入资料、验收条件、首次通过率、重试次数、人工复核时间和费用放在同一张表里。最后的建议可以是“默认模型 + 复杂任务例外 + 下次复测时间”,而不是用一个分数决定所有工作。

让结论能用于决策

有些复杂、例外多的工作值得使用更强的模型;字段提取等稳定任务可能更看重规模成本。建议在报告里同时呈现合格率、事实错误、引用遗漏、返工时间和费用,而不是选一个“总冠军”。若样本太少或外部评测条件不一致,就把待验证事项列出来。

可以把官方公告、账单、已获准使用的匿名任务样本和验收要求交给 MuseWork,整理成证据对照、试点方案与可审阅的选型简报。可直接提出:“根据这些公开资料和三份匿名工作样本,制定模型试点方案,比较来源准确性、返工时间与合格成品总成本,并标出未经实测的结论。”

从新闻走向手头的工作

把自己的资料、报表和来源交给 MuseWork,形成可以继续审阅的简报。开始一项研究任务,或先了解深度研究

离开电脑也能在手机上继续查看任务:下载 MuseWork iPhone 或 Android 版。需要处理本机文件,可在授权后下载 MuseWork 桌面端

资料来源

下载 MuseWork 桌面客户端

经你授权后,MuseWork Desktop 可以在浏览器和本地文件中开展工作,为你完成任务。

MuseWork 桌面客户端工作区预览