一个配方体系里,到底有多少种组合值得测
一个中等复杂度的材料体系——比如某类复合材料,涉及基体树脂比例、填料种类、填料粒径、偶联剂用量、成型温度这五个可调变量,哪怕每个变量只取8到10个离散水平,组合总数也能轻松超过五万种。按传统方式,每组配方从配料、成型到测试完整跑一遍,少则一两天,多则一周,把五万种组合全部做完在时间和材料成本上都不现实。问题由此变成:能不能不用测完所有组合,也大致定位到性能最优的那一小片区域。
主动学习选的不是“还没测过的”,而是“最能消除不确定性的”
主动学习和均匀取样的区别在这里:均匀取样是不管模型现在懂多少,固定间隔挑一批去测;主动学习则是先看当前模型在哪些区域预测得“心里没底”——也就是不同候选点的预测方差特别大,或者几个子模型给出的结果彼此分歧明显——优先把实验资源投到这些区域。如果某个区域模型已经能给出很窄的置信区间,继续在那里堆实验对整体认知帮助有限,即便那个区域看起来性能也不错。这个筛选逻辑,正是材料逆向设计给出候选清单之后,决定“先验证哪一个”的关键一环。
贝叶斯优化负责把“测哪个”变成一个可计算的问题
具体到算法层面,常见做法是用贝叶斯优化维护一个概率模型,每做完一批实验就更新一次对整个候选空间的性能分布估计,再用一个“采集函数”综合考虑预测均值(看起来好不好)和预测方差(有多不确定)算出下一批最值得测的点。这样做的好处是每一轮实验都在为下一轮提供更有针对性的信息,而不是重复投入在已经比较确定的区域。
示例:某复合材料填料比例的搜索,几轮之后范围收窄到什么程度
为便于说明,假设一个模拟场景:目标是在某复合材料里,把无机填料占比从15%到45%之间找到抗拉强度最高的比例点。第一轮均匀测试5个比例(15%、22%、30%、37%、45%),模型据此建立初步曲线,发现30%附近强度较高但两侧数据稀疏、置信区间偏宽;第二轮主动学习就会集中在27%到33%这个区间再加测4组,而不是继续在15%或45%这类已经比较确定“效果一般”的区域重复投入;第三轮往往能把最优区间收窄到一两个百分点以内。对比起来,如果按固定间隔在整个15%到45%区间等距测试到同样精度,通常需要多测两到三倍的样本量。
主动学习也有软肋:早期数据质量差,后面全跟着偏
主动学习并不是没有代价。它高度依赖前几轮实验数据的质量——如果早期某一批测试因为设备误差或操作问题混入了偏差数据,模型会把这批错误信号当作“真实规律”去指导后续采集方向,后面几轮很可能一直在错误的区域里打转,而且这种偏差往往要等到后期结果明显不合理时才会被发现。这也是为什么早期几轮实验的复核环节,即使在自动化程度较高的流程里也不能省略。
什么时候该停止迭代
什么时候该停止迭代,通常不是看“还有没有更好的点”,而是看新一轮实验带来的置信区间收窄幅度是否已经小于测试本身的误差范围——继续加测边际收益很低的时候,更合理的做法是把当前最优候选转入更严格的验证测试,这部分执行工作会进一步交给自主材料实验室里的自动化实验环节完成,后续新增的实验结果也会通过开云App的持续更新机制重新喂回模型。