AI scientistv2-论文阅读
AI scientist-v2
AI Scientist v1 和 v2 的区别
- More General Idea Generation 他们没有使用代码库增量开发,论文里面说的是采用了更高抽象级别开始的过程
这里需要查看一下,对比AI Scientistv1 和v2 在实验代码上的区别
AI Scientist-v1还依赖于预定义的模板代码作为起始基线实现。LLM驱动的代码更改随后被限制为顺序代码适配。我们现在概述我们消除此限制的策略,从而提高系统的灵活性和自主性
- 有一个管理实验进度的Manager这玩意本质上是个超参数搜索器,太抽象了 先基于可以运行的最小工作原型验证可行性,然后优化关键超参数,然后用调整后的基线系统地研究已成,最后再消融实验。 每个阶段都有明确的停止标准。第一阶段结束时,一个基本的工作原型成功执行。第二阶段结束时,实验稳定,如训练曲线中的收敛和在至少两个数据集上的成功执行所指示的。当分配的计算预算耗尽时,阶段3和4结束。阶段3还包括对实验持续时间的检查-如果运行完成得比之前快得多,分配的运行时间,系统建议增加实验的复杂性。
分类Agentic搜索树 每个实验节点经历以下执行周期:LLM首先生成具体的实验计划和相关的Python代码来实现实验。生成的代码立即在Python解释器中执行如果执行遇到错误,则记录错误消息,并将节点标记为buggy,结束该节点的当前执行周期。如果执行成功,则实验继续到绘图阶段。 这里很显然是不行的 同时注意到他们绘图和实验是分开的。实验过程中的相关实验输出是保存在numpy文件中的。
节点类型
- 超参数节点 系统地探索替代的超参数配置
- 消融节点 评估关键的消融研究,评估实验基础的各种组件或假设的重要性。类似于超参数节点,以前测试的消融条件被跟踪以避免重复,并创建调试节点以响应任何遇到的错误。
- 复制节点 使用不同的随机种子执行它们的父实验的重复。通常,创建几个复制节点以计算实验结果的统计测量(平均值和标准差),从而增强结果的鲁棒性。
- 聚合节点 是为合并和可视化复制节点的组合结果而创建的特殊节点。
总的来说,有点干巴 不用AI润色了