# AA-Briefcase-Lite

**AA-Briefcase 的公开示例场景。AA-Briefcase 是 Artificial Analysis 面向真实、长周期知识工作的前沿智能体评测。**

- [排行榜和详细结果](https://artificialanalysis.ai/evaluations/aa-briefcase)
- [发布文章](https://artificialanalysis.ai/articles/aa-briefcase)

AA-Briefcase 将前沿模型基准测试从编程和短文本推理扩展到知识工作者日常产出的专业交付物。完整基准包含四个私有场景，要求智能体完成跨数据科学、产品管理、银行运营和重工业战略的真实专业工作流。

**本仓库发布第五个场景中一周内容，作为公开的 AA-Briefcase-Lite 示例。** 它展示 AA-Briefcase 在实践中的样子，包括场景上下文、源文件结构、任务格式、评分规则，以及智能体预期要产出的交付物。它比完整基准更小、难度更低，并且**不计入排行榜评分**。评测中使用并展示在 [Artificial Analysis 网站排行榜](https://artificialanalysis.ai/evaluations/aa-briefcase)上的四个场景仍为私有。

## 场景

AA-Briefcase-Lite 是一个商业尽职调查项目。被评测模型的任务是协助虚构美国中型市场私募股权公司 *Halberd Capital Partners* 的一位**副总裁**，对 *Aurora Eggs Ltd* 进行外部视角商业尽调。Aurora Eggs Ltd 是一家私有的新西兰鸡蛋生产商，正被评估为潜在收购标的。交易处于 LOI 前 / 指示性报价准备阶段：智能体必须基于手头材料形成初步判断，并提出确认性阶段需要回答的开放问题。Halberd Capital Partners 和 Aurora Eggs Ltd 都是虚构公司，但场景基于新西兰鸡蛋市场的真实数据。源材料池同时使用真实和合成文档，其中包含有意设置的跨来源矛盾，智能体需要识别并调和这些矛盾。

这一周包含四个交付物，每个都可以独立从源材料池完成：

| 任务 | 工作流 | 交付物 | 格式 |
|---|---|---|---|
| `w1_t1` | 市场结构与竞争格局 | `market_overview.tex` + `market_overview.pdf`（单页） | LaTeX + PDF |
| `w1_t2` | 市场规模、预测与笼养禁令转型模型 | `market_model.xlsx` | XLSX |
| `w1_t3` | 标的评估、机会与风险 | `target_assessment.pptx` | PPTX |
| `w1_t4` | 初步发现简报视频 + 字幕 | `briefing.mp4` + `briefing.srt` | MP4 + SRT |

源材料池包含 67 个来源（147 个文件），分为两组，模拟 AA-Briefcase 在每个场景中的结构：`source_files/shared/`（整个场景期间持续可用的组织背景材料）和 `source_files/week/`（本周任务引入的材料），包括邮件、Slack 线程、数据集、会议笔记和报告。

## 数据集文件

### `checks.jsonl`

该文件每个检查项一行，共 63 行：

| 列 | 含义 |
|---|---|
| `check_id` | `W{week}-T{task}-{type}-{NN}`，例如 `W1-T1-A-01` |
| `task_id` | 检查项所属任务（`w1_t1` 到 `w1_t4`） |
| `week` | 周编号（本次发布中始终为 `1`） |
| `check_type` | `A`（准确性：单一来源事实 / 遵循指令）、`C`（关键洞察：需要调和矛盾来源或发现刻意设置的陷阱）、`AQ`（分析质量）、`P`（呈现质量） |
| `scoring_type` | `binary`（根据规则通过 / 不通过；所有 `A` 和 `C` 检查项）或 `pairwise`（与同一任务中另一个模型提交物进行两两比较；`AQ` 和 `P` 检查项） |
| `taskdoer_output_file` | 被评分的交付物文件 |
| `files_needed` | 包含通过检查所需证据的源文件 |
| `check_description` | 检查项验证的内容 |
| `score_1_criteria` / `score_0_criteria` | 提供给评审模型的通过 / 失败标准 |
| `specific_file_locations` | 支撑证据在源文件中的位置 |

### `tasks.jsonl`

该文件每个任务一行，共 4 行：

| 列 | 含义 |
|---|---|
| `task_id` / `week` | 任务标识和周编号 |
| `task_md_path` | 给智能体的任务说明（`tasks/<task_id>.md`） |
| `deliverable_filenames` | 智能体必须产出的文件 |
| `shared_files` / `week_files` | 为该任务挂载的确切源文件 |
| `scenario_overview_path` / `week_overview_path` | 给智能体的上下文文档 |
| `rubric_path` / `traceability_path` | 评分侧检查定义和证据链 |

## 方法

### 输入

对每个任务，被评测智能体会收到：

- 场景概览（`summary_docs/scenario_overview.md`）和周概览（`summary_docs/week_1/week_1_overview.md`）
- 任务说明（`tasks/<task_id>.md`）
- 以文件形式挂载的任务源材料池（来自 `tasks.jsonl` 的 `shared_files` + `week_files`）

### 运行框架设置

- 基于 [**Stirrup**](https://github.com/ArtificialAnalysis/Stirrup)，即 Artificial Analysis 的开源智能体框架
- 按周划分的完全离线 E2B 沙盒，由本周源文件构建，并预装广泛的科学计算和文档处理工具栈（见下方智能体任务提示词）
- 代码执行沙盒加图像查看工具；智能体通过预装文档处理栈读取材料池中的格式（DOCX、PPTX、XLSX、PDF、HTML、CSV、email 和聊天导出）
- 每个任务最多 500 轮；当上下文窗口填满时，Stirrup 会总结早期历史，使长任务可以继续
- 两个终端工具：finish 工具（简短总结加每个交付物的绝对路径，并验证路径是真实文件）和 abandon_task_finish（放弃）工具，仅当任务确实不可能完成时用理由调用

### 评分

- 检查定义位于 `grader/`：`grading_rubric_w1.json`（检查项和评分标准）、`source_graph_w1.json`（来源到检查项的映射）和 `traceability_w1.json`（每个检查项的证据链；也支持用于验证任务公平性的带提示提交模式）
- 规则检查（`A`、`C`）：严格按规则二元通过 / 不通过，不给部分分
- 两两检查（`AQ`、`P`）：同一任务两个模型提交物之间的头对头比较，返回偏好的提交物或平局
- 每个检查项由来自三个前沿实验室评审模型组成的评审小组之一评分，每个检查项选择不同评审；评审只看到提交物和规则上下文，从不看到源文件
- 排行榜上，二元结果和两两判断通过最大似然 Elo 聚合为 Rubric、Analytical Quality、Presentation 和总体 AA-Briefcase Elo 分数；完整说明见[方法页面](https://artificialanalysis.ai/methodology/intelligence-benchmarking#aa-briefcase)

## 提示词

用于生成和二元规则评分的提示词按 AA-Briefcase 运行框架原样复现。原始文件位于该数据集的 `prompts/` 文件夹。提示词是模板：`{placeholder}` 字段会在运行时填充，`<<<...>>>` 标记展示解析后的提交物内容（文本块、图像块或不支持内容的解析器备注）在评审用户消息中的内联位置。

## 示例提交

`submissions/` 文件夹包含**六个前沿模型**产出的交付物文件，覆盖当今领先系统及大约一年前的对应系统：

| 简写 | 模型 |
|---|---|
| claude-4-opus-thinking | Claude Opus 4（推理） |
| claude-fable-5 | Claude Fable 5 |
| glm-5-2 | GLM 5.2（max） |
| gemini-3-1-pro | Gemini 3.1 Pro |
| gpt-5-5 | GPT-5.5（xhigh） |
| o3 | o3 |

并非每个模型都产出了每个交付物：如果某个模型缺少某个任务文件（例如 o3 没有 `w1_t1` 输出），表示该模型没有产出它们。这些示例仅用于说明，不计入任何模型的排行榜结果。

## 第三方引用

AA-Briefcase-Lite 包含有限的第三方品牌和商标引用，仅用于研究和评测目的。不表示或暗示任何关联或背书。所有商标均归各自所有者所有。AA-Briefcase-Lite 中私人个体的姓名和身份引用均为虚构；如与真实人物或实体相似，纯属巧合。

## 引用

如果你在研究中使用 AA-Briefcase，请引用：

```bibtex
@dataset{artificialanalysis2026briefcase,
  title={AA-Briefcase},
  author={Artificial Analysis},
  year={2026},
  publisher={Artificial Analysis},
  url={https://huggingface.co/datasets/ArtificialAnalysis/AA-Briefcase-Lite}
}
```

## 许可证

基于 Apache License 2.0 授权。
