918搏天堂官方网站机械(江苏)有限公司
售前:0510-87061341
售后:0510-87076718
技术:0510-87076708
邮箱:bk@163.com
微信公众号二维码
微信公众号


18个模子统计108次财报谁最快、最准、最廉价?

  选择模子,不是寻找一个“全能冠军”,更多是按照分歧使命构成组合,正在成本、效率和精确率之间找到最优均衡每逢财报季,研究员、阐发师城市反复一项耗时但不成避免的工做:下载上市公司财报,提取数十个环节财政数据,计较同比增速等目标,并拾掇成表格。一份财报可能跨越100页。研究员需要逐季、逐页阅读、频频查对,再从数字变化中挖掘一家公司的运营趋向。过去三年,这项工做一直没有完全从动化,次要有两个。Wind(万得)等金融数据库无法笼盖所有研究需求。它虽然能供给尺度化数据,但良多公司的细分数据(如微软云计较营业的营收、增速)录。DeepSeek、豆包等AI(人工智能)聊天东西虽然可以或许解析财报并回覆问题,但正在处置多份财报、持续计较、转换复杂口径时,仍屡次呈现错误。2026年,智能体(Agent)和大模子能力提拔,它曾经可以或许持续数小时编写代码。我们想验证一个问题——正在沉度办公场景中,它可否完成雷同使命?为此,《财经》进行了一项试验:通过开源智能体框架OpenCode接入全球支流模子,让18款模子完成统一项财报统计使命。具体使命是:阅读谷歌2020年-2025年的24份财报,统计2021年-2025年20个季度的10个财政目标共200个数据,并生成表格。OpenCode的劣势正在于,能公允接入全球绝大部门模子,降低分歧模子的测试差别。因为ClaudeOpenCode等第三方智能体东西接入,Claude系列模子9次使命通过Claude Code完成。为降低随机要素、使命并行干扰测试成果,《财经》对18款模子别离进行了两轮测试,每轮每款模子施行3次,共完成108次使命。所有测试使命均采用串行体例一一施行。第一轮54次测试,不供给执。模子需要自从拆解使命、选择东西并规划施行流程。第二轮54次测试,正在连结其他前提不变的环境下,按照第一轮测试成果添加施行写入新的提醒词,察看模子可否进一步提拔效率。《财经》最终记实了这18个模子108次使命的精确率、Token(词元)耗损量、使命时长、看谁用时最短、成果最准、成本最低。第一,成果能被客不雅验证。比拟一句话生成逛戏、一句话生成研究演讲等使命,门槛较高。第二,它是开务。模子要自从规划执、选择东西、编写代码,从PDF文件中提取拾掇、计较、复核数据。第三,它的Token耗损大且使命时间跨度大。分歧的模子一次完整使命要耗损数百万以至万万Token,耗时3分钟-120分钟。这个测试更切近实正在办公使命,也会模子的一部门代码能力。以上要素叠加,分歧模子的统计精确率、使命时长、Token成本差距会显著拉大。不外,需要申明,这不是严酷意义上的机能基准测试。测试成果仅代表模子正在财报统计这种沉度办公场景中的表示。本文中会商的成本均按照官网API列表价折算,并不等于用户正在Token Plan(Token订阅套餐)中的现实账单。第一轮测试中,《财经》仅向18款模子设定使命方针,不供给执。模子需要自从理解使命、寻找财报、挪用东西、编写代码并生成表格。至多正在财报统计这一沉度办公场景,国产模子曾经具备接近海外旗舰模子的能力,同时Token成本更低。DeepSeek-V4-Flash(正式版)成本以至只要Claude Opus 5的不到3%。复盘错误成果能够发觉,模子实正容易踩坑的,并非复杂的财政阐发,更多呈现正在单元、统计口径和数据核验等根本环节。第一类圈套,是单元换算时错了一位小数点。财报中的单元凡是是百万美元,统计要求利用亿美元。Claude Sonnet 5正在第三次测试中,把553。1亿美元的季度营收写成5531。4亿美元。五项金额目标均被全体放大10倍,一次单元错误便污染了100个单位格。第二类圈套,是生成了表格,却没有完成无效查抄。小米MiMo V2。5 Pro第三次测试虽然成功输出文件,但200个方针单位格全数为空,精确率为零。文件可以或许打开,并不等于使命曾经完成。第三类圈套,是把累计数据误认为单季度数据。谷歌财报中的本钱收入凡是采用岁首年月至今累计口径。计较单季度数据时,二季度、三季度需要减去此前季度的累计值,四时度则需要用全年数据减去前三季度。小米MiMo V2。5 Pro曾间接把累计本钱收入填入季度表格,本钱收入及其占营收比例因而持续犯错。第四类圈套,是计较过程中过早四舍五入。MiniMax M3、DeepSeek-V4-Flash(预览版)、DeepSeek-V4-Pro和Doubao-Seed-2。1-Turbo均呈现过雷同问题。例如,59。4亿美元被提前四舍五入为59。0亿美元。单个数字误差看似不大,但它后续会传导至本钱收入率计较过程中,导致错误被放大。这些错误申明,财报统计调查的不只是模子可否识别数字,更调查它可否正在一条完整的工做流中同时做到理解统计口径、算清小数点精度、输出Excel表格而且最终查抄验收。模子的差距,是正在这些根本环节被拉开的。两头一旦犯错,错误会像滚雪球一样放大。其一,尽快确定东西线份PDF,而是把PDF格局的文件批量转换为TXT文本,再针对10个目标相关的文字进行检索。其二,识别财据的统计口径。谷歌财报中本钱收入数据往往是季度累计值,需要拆分数据而且从头计较,谷歌第四时度也凡是需要利用全年数据减去前三季度。可否识别这些财政口径的圈套,间接决定整张表格能否准确。其三,把反复工做交给代码脚本。高效模子凡是会用简练的体例编写代码脚本,同一完成数据提取、季度差分、单元换算、增加率计较和Excel生成等使命。较慢的模子则可能正在分歧年份、分歧目标之间频频切换东西,发生大量反复挪用。其四,晓得什么时候该当遏制使命。完成Excel之后,一些模子会核验季度数量、公式、负数、单元和环节单位格,确认成果准确后便竣事使命。另一些模子即便曾经接近谜底,仍会继续搜刮、沉写代码或反复读取文件,由此拉长使命时长,耗损更多Token。但正在现实利用中,决定成本的并不只是Token单价,还包罗Token耗损量——这些耗损包罗,模子为完成使命挪用了几多轮、反复读取了几多上下文、能否频频改换东西,以及失败后能否需要从头施行。统一项使命,有的模子很快找到准确径,用很少的Token处理问题。但有的模子不竭搜刮文件、反复读取上下文、点窜脚本。后者即便Token单价较低,也可能由于Token耗损量导致最终的账单更贵。第一轮测试中,MiniMax M3平均每次耗损约1063万Token,是Kimi K3约47万Token的22倍以上。虽然MiniMax M3订价低于Kimi K3,但低价并没有完全抵消冗长执带来的Token耗损,最终导致单次平均成本较着更高。另一类成本来自数据错误形成的返工成本。DeepSeek-V4-Pro单次成本只要约0。52元,但平均精确率只要93%。若是正在对精确率高的场景,将人工核验、数据批改和从头运转的费用计较正在内,它的实正在交付成本会远高于账单数字。对企业来说,百万Token订价只要参考价值。准确完成一次使命要付几多钱,才是实正在成本。实正在的无效使命成本=API成本+失败沉跑成本+人工核验取返工成本+时间成本。但它既不克不及代表示实工做价值,也不克不及代表示实成本。分歧模子,Token价值分歧。机能强的模子,能够用更少Token完成更多工做。机能弱的模子,用更多Token也可能无法精确交付工做。以谷歌2025年四时度演讲为例,这份接近100页财报包含约4。8万个英文单词。把表格、数字、标点符号等内容计较正在内,有跨越5。2万个文本,大约相当于7万-8。6万Token。若按附近规模估算,24份财报合计可跨越160万Token。正在智能体使命中,每一轮东西挪用,系统都可能从头向模子发送使命申明、汗青对话、东西前往成果和PDF文件内容。它们能够只用少量Token思虑径、生成代码,再挪用pdftotext、Python和Excel等软件批量完成数万次文本读取和200个Excel单位格的计较。相反,能力衰的模子容易华侈Token,它们会频频打开PDF,屡次挪用东西或正在错误径上来回测验考试,或者挪用多个子智能体。统一批文件被多次传回模子,不异的内容被读取十次,Token耗损就可能增加10倍,但此中大部门Token都被用于反复读取和试错。这轮测试中,最好的案例是月之暗面 Kimi K3,三次使命平均Token耗损量47万,是18款模子中Token耗损起码的。其次是GPT-5。6 Sol,三次使命平均Token耗损量78万。它们都连结了100%的精确率。但反例是Claude Sonnet 5,它的三次使命平均Token耗损1144万,是所有模子中最高的,是Kimi K3的24倍。但三次使命的平均精确率只要83。3%,分析表示排名倒数第4。第一轮测试中也呈现了一些出人预料的成果:部门参数规模并不占优的模子,表示出了更高的性价比。部门定位高端的模子,因为把简单问题复杂化,反而最终表示欠安。腾讯Hy3正在本轮测试中,三次使命平均精确率达到99。5%,单次使命成本仅0。91元,平均耗时7分54秒,平均Token耗损288万。Hy3平均使命时长、Token耗损量接近海外旗舰模子,但Hy3的参数规模仅为2980亿。它的定位是办公,并不适合用于处理复杂代码工程问题。此次使命次要调查财报理解、数据拾掇、表格生成能力。这取它的能力范畴很婚配,因而Hy3取得了较好的测试成果。Hy3较早识别出这项使命的尺度处置径。它将PDF转换、季度拆分、公式计较和Excel查抄快速串成一条工做流,削减了东西试错。取此同时,较高的缓存占比和较低的API单价进一步压低了成本。定位中高端的Claude Sonnet 5分析表示排名倒数第4。三次使命中,它的平均成本达到56。64元,是所有测试模子中最高的一款。此中一次使命精确率以至下降至50%。Claude Sonnet 5虽然代码能力强,但打开三次测试记实发觉,它正在施行使命时,经常自动多智能体(Sub-Agent)模式,将使命拆解为多个子使命并行施行。这种“想太多”的做法,导致了更长的使命时长,更大的Token耗损。Claude Sonnet 5三次使命平均耗时13分50秒,平均Token耗损1144万,远高于腾讯Hy3。“想太多”的策略正在复杂软件开辟中可能能够对付Bug(法式错误),但正在财据提取这类流程相对明白的使命中,反而把简单问题复杂化,以至导致最终成果犯错。为验证优化提醒词可否改善模子表示,《财经》察看了第一轮54次使命中,精确率100%的模子东西利用径的类似之处:先批量把PDF文件转成TXT格局,再用代码同一提取数据,用累计值分拆单季度数据,用全年数据倒算四时度,最初查抄表格数据。正在第二轮54次使命中,《财经》把这个方式总结成一段86字的施行,写进新的提醒词,继续察看模子表示变化。18款模子54次使命总耗时下降39。7%,总成本降34。9%,Token总耗损从2。1亿下降至1。71亿,降幅18。7%。全体精确率从91。2%提拔至93。2%,提高2个百分点。提拔最较着的是小米MiMo V2。5 Pro。它正在第一轮三次平均精确率42。7%,此中一次200个数据全数犯错。写入施行后,平均精确率升至95。5%,最低一次也有95%,平均耗时从59分36秒降至29分10秒。一些上一轮测试就交出满分答卷的模子,施行时间大幅下降。阿里Qwen 3。8-Max(预览版)的平均耗时下降42。6%,平均成本下降31%。DeepSeek-V4-Flash(正式版)平均耗时下降67。7%。提醒词无法改变模子的智力上限,但能提拔模子的下限——提前规划径,帮模子免却选东西、试错和返工的成本。能力较强的模子往往曾经具备纠错能力。径被规划后,它需要先满脚步调要求,纠错空间随之收窄。特别是过长、细致、节制过多的提醒词,反而会添加从命成本,反而导致更多的错误、更高的时间成本。对能力较弱的模子,细致的提醒词是一套防止走偏的护栏。但对脚够强的模子来说,过多也可能变成,这以至会放大错误。第二轮测试中,GPT-5。6 Sol、Qwen 3。8-Max(正式版)都呈现了Token耗损变多、使命时长变长的环境。GPT-5。6 Sol平均使命时长从第一轮约4分28秒添加至第二轮约5分32秒,Token耗损同步增加约10%;Qwen 3。8-Max正式版平均使命时长从约13分钟添加至约17分钟,Token耗损增加约47%。有算法工程师对《财经》暗示,模子需要破费更多留意力满脚步调要求,而不是按照现场环境从头规划。因而提醒词该写到什么程度,也是技巧。脚够强的模子来说,只需要给出方针和验收尺度。能力不不变的模子,才需细致的提醒词当做护栏。阿里Qwen 3。8-Max(预览版)的精确率就曾经是100%,正式版进一步降低了施行成本。平均Token耗损从316。5万下降至179。1万,削减43。4%。平均使命时长从25分45秒缩短至18分46秒,下降27。1%。单次使命成本从7。74元下降至6。21元,降低19。8%。这两轮测试中,DeepSeek-V4-Flash、阿里Qwen 3。8-Max(正式版)的机能提拔,取开辟者社区反馈根基分歧。一位算法工程师向《财经》暗示,“预锻炼凡是决定模子学问鸿沟,但后锻炼决定模子若何完成具体使命。”模子从预览版升级到正式版的过程中,凡是会继续优化后锻炼流程,包罗优化东西挪用能力、推理策略。通事后锻炼,模子厂商能够充实挖掘模子的潜力。这就像是一个“不成能的三角”:最快、最准的模子凡是并未便宜,价钱更低的模子往往需要用更长的时间完成使命。相对而言,月之暗面Kimi K3表示出了较好的分析均衡:三次使命精确率均为100%,平均耗时约10分29秒,单次成本2。89元。它虽然没有海外旗舰模子快,但将使命节制正在10分钟摆布,成本仅相当于Claude Opus 5的31%、GPT-5。6 Sol的41%。正在财报统计这种沉度办公使命中,DeepSeek-V4-Flash(正式版)看似和Claude Opus 5、GPT-5。6 Sol差距不大,但正在对付更难的工做时,它会显得力有未逮。《财经》测试发觉,正在复杂的代码使命,好比面临半个月都难以完全修复的Bug时,DeepSeek-V4-Flash(正式版)和Claude Opus 5、GPT-5。6 Sol的差距会被敏捷拉大。模子评测容易陷入一个误区:只看精确率榜、耗时榜、价钱榜,从三张榜单中寻找各自的冠军。但实正在企业场景并非如斯。企业采购AI时,凡是不会寻找某一个维度的绝对第一。比拟每百万Token价钱,企业更关怀的是:完成一次准确使命,若何选择模子,取决于使命特点——事实更看沉成本、时效,仍是精确性。这两轮108次测试表白,模子选择并不存正在独一谜底。对于时间型使命,企业可能情愿为更快响应领取溢价;对于大规模批量使命,较低的单次使命成本愈加主要;而对于财报阐发、审计、合规等高风险使命,精确率和不变性则是不成的底线。正在高风险使命中,精确率该当成为第一槛。只要达到100%精确率交付要求的模子,才有资历进一步比力效率和成本。从测试成果看,GPT-5。6 Sol、Claude Opus 5、Kimi K3等模子更适合这类对精确率要求较高的场景。而对于客户办事、内容创做、一般的行业研究等场景,成本和响应速度的主要性会上升。DeepSeek-V4-Flash(正式版)、腾讯Hy3成本更低,正在这类场景中较着有劣势。因而正在现实中,选择模子不是寻找一个“全能冠军”。更多是按照分歧使命成立模子组合,正在成本、效率和精确率之间找到最优均衡。

  • 发布于 : 2026-08-08 08:52


0510-87061341 (售前)
0510-87076718 (售后)
0510-87076732 (技术)

微信公众号

微信服务号