果热科技新闻资讯频道上线,持续更新 AI 交付实践
新闻资讯 / 正文

当 AI 开始自动寻找更优方案,企业真正稀缺的是“评分函数”

过去两年,企业讨论 AI,常把重点放在模型能生成什么:一份报告、一段代码、一套方案,或者一次完整的任务执行。

企业级新闻 发布时间:2026-08-18 10 分钟阅读
企业算法评估团队在计算化学实验室审查 AI 候选方案与测试结果
生成能力扩大候选空间,企业的评估机制决定优化方向。

过去两年,企业讨论 AI,常把重点放在模型能生成什么:一份报告、一段代码、一套方案,或者一次完整的任务执行。

但最近出现的一类进展,正在把问题推向更深一层:当 AI 不只生成一个答案,而是可以连续提出成千上万个候选方案、自动测试、保留更优者并继续迭代时,决定最终结果的,未必是模型有多会“想”,而是企业能否准确回答——什么才算更好?

2026 年 7 月,Google Cloud 宣布算法发现与优化工具 AlphaEvolve 正式商用。它的基本机制并不神秘:企业提供初始程序、问题定义和评价逻辑,系统生成候选代码,再由自动评估器检查、打分和筛选,进入下一轮演化。生成能力负责扩大搜索空间,评估能力负责决定搜索方向。

这一变化值得企业管理者关注,因为它提示了 AI 落地的新分水岭:未来,很多组织都能获得强大的生成能力,但只有少数组织能够把经营判断写成可靠、可执行、不会被“钻空子”的评价机制。

一个 4 倍提速案例,真正值得看的不是“AI 会改代码”

Schrödinger 是一家长期从事计算化学软件和药物、材料研发的企业。Google Cloud 6 月披露的案例显示,其机器学习力场训练流程中,两类底层算法成为性能瓶颈。其中,Ewald summation 原有 PyTorch 实现缺乏成熟的向量化算法,在大型模拟中运行缓慢。

AlphaEvolve 生成了使用并行批量矩阵乘法的新实现。Schrödinger 没有仅凭运行速度接受结果,而是设置了多层评估:以计算耗时衡量吞吐,同时要求候选程序通过完整测试套件,并在无序水模型等复杂系统上做回归验证。最终披露的结果是,相关优化令机器学习力场的训练和推理速度提升约 4 倍。

这里最容易被误读成“AI 替代专家写出了更快的代码”。实际上,案例中更有价值的能力是:专家先识别出值得优化的瓶颈,再把性能、功能正确性和科学准确性共同写入评估框架。没有这些边界,AI 可能非常高效地优化一个错误目标。

换句话说,AI 扩大了企业提出方案的产能;企业自己的评估器,决定这种产能会变成价值,还是变成规模化偏差。

业务、数据与技术团队共同审查评分函数的约束、目标、验证与边界
可靠的评分函数需要硬约束、目标函数、验证方法与适用边界共同作用。

评分函数不是一个 KPI,而是经营逻辑的可执行版本

企业并不缺 KPI。真正困难的是,许多业务目标同时包含多个互相制约的条件,而且大量条件仍停留在专家经验、会议讨论和事后否决中。

例如,排产方案不能只追求设备利用率,还要考虑交付期、切换成本、质量风险和人员约束;营销方案不能只追求点击率,还要守住毛利、品牌承诺和客户长期价值;采购方案不能只压低价格,还要计入履约稳定性、替代周期和合规风险。

因此,可供 AI 反复优化的“评分函数”,至少应包含四层内容:

这四层共同构成的,不只是技术测试脚本,而是企业经营逻辑的一种可执行表达。它把“我们通常认为这样更好”变成了能够被检查、质疑、更新和审计的组织资产。

  • 硬约束:任何候选方案都不能违反的法规、安全、权限和业务规则;
  • 目标函数:真正希望提高或降低的经营结果,并明确各目标之间如何权衡;
  • 验证方法:用什么数据、测试和对照组判断方案确实更好;
  • 适用边界:评分在什么场景、数据分布和时间条件下有效,何时必须由专家重新判断。

最危险的结果,是分数提高了,业务却变差了

当系统能够高速搜索时,模糊指标的风险也会被同步放大。一个候选方案可能通过缩短处理时间获得高分,却把复杂问题推给下游;可能提高预测准确率,却只在历史数据常见区域表现良好;也可能通过规避难例,让平均指标看起来更漂亮。

这并非某个产品特有的问题,而是所有“生成—评价—继续优化”系统的共同治理难题。Google DeepMind 对 AlphaEvolve 的技术说明也明确指出,这类方法更适合可以被清晰、系统衡量的问题;论文则将“能否设计自动评估器”列为主要适用限制之一。

因此,企业不能把当前指标直接包装成 AI 的最终目标。更稳妥的做法是建立一组相互制衡的评价结构:主目标衡量收益,护栏指标防止代价外溢,回归集防止已有能力退化,压力测试覆盖少见但高后果的情况,最后再由领域专家对无法完全量化的部分做判断。

评分函数还必须有版本。市场价格、客户偏好、法规和内部策略都会变化。一次验收通过的评价逻辑,不应被永久视为真理。企业需要记录每次指标调整的原因、审批者、适用数据和对历史方案的影响,才能知道 AI 的结果究竟因模型变化,还是因“什么算好”的定义发生了变化。

企业可以从一项“可自动判分”的难题开始

这类能力不必从药物研发或复杂算法发现起步。很多企业已经存在适合验证的窄问题,例如降低一个高频计算任务的耗时、优化仓储装箱、改进报价组合,或者在明确约束下调整能源使用策略。

选择首个场景时,可以用三个问题筛选:

随后,让业务专家、数据团队和技术团队共同完成一份“评价契约”:写清硬约束、优化目标、测试数据、基线方案、停止条件和最终审批责任。先让 AI 在隔离环境中挑战现有基线,再用未参与优化的数据复验,并保留原方案作为可回退版本。

值得衡量的也不只是“AI 找到了多少方案”,而是:有效候选比例是否提高,验证一次候选的成本是否下降,从发现到生产验证需要多久,以及最终业务结果是否持续优于原基线。

  • 结果是否能在较短周期内被客观验证;
  • 错误方案是否能在进入生产前被测试拦截;
  • 优化带来的改善是否能映射到成本、收入、风险或交付周期。

结语

生成式 AI 正在让“提出方案”越来越便宜。接下来真正昂贵的,是定义好方案、识别伪改进,并把复杂的经营判断变成可重复验证的规则。

Schrödinger 的 4 倍提速是一个有边界的计算优化案例,不能直接等同于研发周期缩短 4 倍,更不能外推为 AI 已经自动完成药物发现。但它清晰展示了一种新的企业能力:当领域知识、自动评估和 AI 搜索形成闭环,AI 不再只是帮助员工更快完成已有步骤,而可以持续探索人力难以穷举的改进空间。

模型会越来越普及,候选方案会越来越多。真正形成差异的,将是企业能否把“什么值得追求、什么绝不能牺牲、怎样证明结果更好”写清楚,并让这套判断随着业务一起演进。

引用来源

以下公开资料用于支撑本文观点,便于读者进行可信校验。

企业级新闻评分函数自动评估AI治理

继续阅读

了解更多 AI 交付实践与行业观察。

2026-09-11 企业级新闻

系统都显示正常,经营数字却已经错了:企业 AI 应补上“最后一公里验证”

很多企业已经为数据平台建立了完整监控:服务器在线、接口响应正常、数据管道按时结束、仪表盘页面也能打开。可到了经营会议前,用户仍可能看到空白图表、过期数字,甚至同一个指标在两个页面上给出不同结果。

阅读全文
2026-09-10 企业级新闻

AI 进入跨境物流后,企业应把“到岸意外”前移为“发货前决策”

2026 年 9 月 8 日,Amazon 宣布其跨境贸易服务 PreDepart 通过万国邮政联盟(UPU)TechCert 技术认证。按照发布信息,邮政运营商可以通过既有的 UPU 海关申报系统或 API,接入商品税则分类、税费计算、原产国信息处理和启运前申报草拟等能力,并在寄件地收取目的地关税与税款。

阅读全文
2026-09-09 企业级新闻

新模型发布后,企业最该重做的不是技术选型,而是“需求积压表”

2026 年 9 月 8 日,OpenAI 在介绍最新进展时提出:模型能力提升、计算效率改善之后,一些过去受制于时间、成本或专业能力的工作,开始变得可行。这句话比“又一个更强模型发布”更值得企业管理者关注。

阅读全文

希望持续关注企业 AI 落地实践?

可与我们沟通关注的行业和业务方向,持续了解相关交付方法、案例观察与能力更新。

沟通关注方向
果热科技
果热科技