0%

LLM Benchmarks Study

ARC-AGI-3

推理模型enable atomation的两个前提 [ARC-AGI-3]

  1. base model contains sufficient knowlegde
  2. domain provides an exact correctness feedback

需要OOD benchmark design 让model不可以pretrain就学到

ARC-1/2:给你几道例题,让你推断规则。
ARC-3:直接把你扔进一个陌生游戏里,不告诉你规则、目标和操作逻辑,你要自己试、自己学、自己规划。

ARC-3 官方现在有大约 135 个抽象交互环境,都是 turn-based 的二维 grid 世界。Agent 每一步看到当前状态,然后选择一个动作;不同游戏可用动作不同,有的还带坐标。

AI学习在Minecraft

Minecraft 没有明确的最终任务。如果只告诉智能体“自由探索”,它很容易:

  • 重复砍树等简单行为;
  • 一开始就尝试获取钻石等过难任务;
  • 不知道什么算“有价值的新进展”。

它的三个组件分别回答:

  1. Automatic Curriculum:接下来学什么?使用一个 GPT-4 实例充当“导师”。它每次只提出一个具体、当前可完成但又稍有挑战的目标,(in-context novelty search)
    1. 有点像tencent的 environment evolution for terminal agents: 让agent永远有“差一点”就会的题 【insight:我们也许需要从简单到复杂的题目】
  2. Iterative Prompting:当前任务怎样通过试错做成?
  3. Skill Library:做成以后,如何记住并复用?

CodeBench (ICLR’24)

任务包括

  1. 代码env,OS (Bash,工具使用), Databse, Knowledge Graph,
  2. gaming
  3. web shopping, browsing
    任务平均需要约 5–35 轮交互。测试集共 1,014 个任务,预计产生约 11,000 次模型调用。