返回总首页Agentic Knowledge Work Benchmark / AA-Briefcase-LiteHugging Face 原始数据集

AA 公文包知识工作评测

先理解评测环境,再阅读文件

这是一个模拟私募股权交易团队的 agentic knowledge work 评测。Agent 需要在离线资料环境中完成四条彼此独立、但共同服务于同一个交易判断的工作流;评测不仅看结论,也看证据、结构、格式、可审计性和交付是否真正可用。

00 / 基准导言

为什么要把模型放进一只“工作公文包”

短问答可以检验模型是否知道一个答案,却很难说明它能否接手一段真实工作。Artificial Analysis 在 2026 年 6 月推出 AA-Briefcase,就是要把评测对象从“回答问题”推进到“完成项目”:Agent 要在大量零散、冲突且跨格式的材料中找到证据,理解机构背景和隐含要求,完成可计算、可审阅、可继续使用的专业交付物。

从单题推理到连续项目

完整基准包含数据科学、产品管理、银行运营和重工业战略四个保密的多周项目,共 91 个任务。任务按周共享机构语境,但当前每个任务仍独立运行,不继承模型之前的成品。

从长上下文到上下文治理

完整基准共有近 2,000 份源文件,涵盖文档、表格、演示、数据导出等多种格式。邮件与 Slack 是其中两类导出材料;展开这些导出文件后,可读到 3,500 多封邮件和 25,000 条 Slack 消息。前者是文件层计数,后两者是消息层计数,不能直接相加。

从漂亮答案到可用交付

模型要制作财务模型、董事会演示、设计稿等真实文件。评测同时检查事实与要求是否逐项满足、分析是否严谨、呈现是否专业,避免把“看起来不错”误判成“工作已经完成”。

4保密多周项目
91专业任务
近 2,000源文件(文件层)
3,500+邮件(消息层)
25,000Slack 消息(消息层)
完成度,而不是分数

“完成一个任务”意味着全部要求同时成立

这里把严格完成定义为:一个任务的所有二元 rubric 条件都通过。它不同于平均 rubric 通过率,也不同于分析质量、呈现质量或综合 Elo;一个模型即使完成了多数局部要求,只要还漏掉一项隐藏要求、证据链、公式或文件规范,就不能算严格完成。

截至 2026-07-14

前沿模型的官方完成披露(历史快照)

下表不展示 Elo 或平均通过率。除 Fable 5 外,官方公开页没有逐模型发布“全部 rubric 条件通过的任务占比”;因此只能确认这些模型已被纳入截至该日期的结果,不能据排行榜分数反推严格完成率,也不能断言每次运行都产出了 91 项可用交付。

模型评测状态严格完成率公开信息
Claude Fable 5已纳入截至该日期的官方评测3%官方明确披露:仅 3% 的任务通过了全部 rubric 条件。
GPT-5.6 Sol(max)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。
Claude Sonnet 5(max)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。
Claude Opus 4.8(max)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。
Grok 4.5(high)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。
Claude Opus 4.7(max)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。
GLM-5.2(max)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。
GPT-5.5(xhigh)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。

截至 2026-07-14,官方结果页收录 46 个模型;此处聚焦截至该日期的结果中的代表性前沿配置,不把榜单名次或 Elo 当作任务完成度。

阅读边界

后面的材料只是一份公开样本

AA-Briefcase-Lite 是第 5 个公开场景中的一周:它用虚构的 Halberd 与 Aurora 交易、真实的新西兰蛋品市场数据以及刻意设置的跨来源冲突,展示场景上下文、资料结构、任务、评分和提交长什么样。它规模更小、难度更低,不进入官方排行榜,也不是四个保密项目的缩略成绩单。

这份样本包含1 周尽调故事67 个来源 / 147 个文件4 个独立交付63 项检查
正式 AA-Briefcase91 个任务4 个保密多周项目,构成官方评测结果
对比
后文 AA-Briefcase-Lite4 个任务1 个公开场景中的 1 周,仅作结构演示

Lite 的任务数约为正式基准的 4.4%。这只是数量对比:Lite 本身更小、难度更低,不能把它理解为正式基准按 4.4% 等比例抽样,也不能用后文样本提交推断模型在 91 个正式任务上的完成度。

仅检查文件是否存在

本地 Lite 样本的交付完整度

这里的 4/4 只表示仓库里四项任务都有提交文件,不表示内容正确、rubric 通过或任务完成。后文会逐任务展开这些提交的做法和局限。

Claude 4 Opus Thinking
任务 1有交付任务 2有交付任务 3有交付任务 4有交付
4/4
Claude Fable 5
任务 1有交付任务 2有交付任务 3有交付任务 4仅字幕
4/4
Gemini 3.1 Pro
任务 1有交付任务 2有交付任务 3有交付任务 4有交付
4/4
GLM 5.2
任务 1有交付任务 2有交付任务 3有交付任务 4有交付
4/4
GPT-5.5
任务 1有交付任务 2有交付任务 3有交付任务 4有交付
4/4
o3
任务 1缺交付任务 2有交付任务 3有交付任务 4有交付
3/4
198完整源数据文件(含未托管视频)
147业务资料文件
63评分检查项
99.6 MB完整源数据体量
01 / 故事背景

一项跨太平洋蛋白平台交易,为什么需要四种不同的 Agent 工作?

AA-Briefcase-Lite 把 Agent 放进一个接近真实交易团队的工作现场:Halberd Capital Partners 正在评估新西兰私人蛋鸡生产商 Aurora Eggs,作为北美农业食品平台的跨太平洋 tuck-in。交易尚处于 pre-LOI / indicative-bid prep,团队要的是 outside-in 初步判断,而不是未经验证的最终投资结论。

A

交易从哪里开始

Halberd 已有北美农业食品平台,Sector Partner 认为 Aurora 可能带来跨区域协同。但 Aurora 是私人公司,公开市场资料看不见它的完整份额、客户和盈利结构,因此必须把公开资料、访谈、内部文件和卖方材料拼起来。

B

行业正在发生什么

新西兰蛋鸡行业经历两阶段转型:第一阶段在 2022 年底前退出传统 battery cage;第二阶段由 Foodstuffs、Woolworths NZ 等零售商推动,要求包装壳蛋逐步转向 cage-free。监管要求、零售承诺、消费者压力和供给转换节奏并不完全相同。

C

Aurora 的核心矛盾

Aurora 被描述为按产量计的 #2 生产商,生产组合中 colony-cage 暴露较高。价值机会在于保住主要零售渠道并完成 colony-to-barn 转换;主要风险在于资本开支、资源许可、雏鸡供应、转换期间的产量损失、价格溢价压缩和执行时点。

D

为什么不能只看一个答案

材料刻意混合了行业报告、专家访谈、Slack、邮件、内部政策、无关组合公司董事会材料和不同模型的示例提交。Agent 必须判断哪一份材料回答哪个问题,识别噪声和冲突,并把“已知、推断、待验证”分开。

2022传统笼养退出的监管阶段完成
2024-25H7N6 生物安全事件带来额外成本与延迟
2025-26市场处于零售承诺、转换和价格重估阶段
2027主要零售商承诺推动 cage-free 货架转换
下一步确认 Aurora 的转换执行、收益和风险

评测环境

读者应该先建立这张“工作现场地图”:谁在做什么、交易到了哪一步、Agent 面对什么约束。

交易场景

Halberd Capital Partners 是一家约 80 亿美元 AUM 的美国中型私募股权机构。交易团队正在评估新西兰私人蛋鸡生产商 Aurora Eggs,作为北美农业食品平台的跨太平洋 tuck-in。当前阶段是 pre-LOI / indicative-bid prep:目标不是做最终投资结论,而是形成 outside-in 初步观点,并列出确认性尽调必须回答的问题。

Agent 角色Halberd 交易团队 VP
目标公司Aurora Eggs Ltd
核心行业变化传统笼养退出、零售驱动 cage-free 转型
主要不确定性转换资本开支、供应、价格和执行时点

环境约束

Agent 无法向用户提问,必须独立完成任务;运行环境离线,只能读取本地共享资料和本周资料;最终必须按指定文件名保存交付物,并通过 finish 工具提交绝对路径。

输入共享资料池 + 本周资料池
处理本地 PDF、Office、邮件、Slack、HTML、字幕等
输出图、模型、deck、视频与字幕
判断原则区分事实、假设、冲突证据和待验证问题

一条评测工作链路

四个任务彼此独立可完成,不允许用另一个任务的成品替代本任务所需的证据和推理。

01 / 读取上下文理解 scenario、week、当前任务和交付约束。
02 / 组合证据从不同格式材料中抽取数字、事实、观点和来源。
03 / 处理冲突识别早期草稿、专家访谈、公开资料之间的不一致。
04 / 形成交付把研究转化成图、Excel、投委会 deck 或口头简报。
05 / 可审计提交保存指定文件、引用具体证据、列出假设和知识缺口。

任务地图

每张卡片都回答三个问题:Agent 要读取什么、要交付什么、评分器会检查什么。

w1_t1独立可评分 workstream

市场结构图

新西兰鸡蛋市场由谁生产、通过什么渠道销售,Aurora 位于价值链的哪一段?

Agent 要读取共享资料池 + 本周资料池;需要在冲突来源之间做出处置和标注。
Agent 要交付单页 LaTeX/TikZ 图和 PDF;必须能看出生产系统、渠道、规模、价值链和 cage-free 转型。
Judge 要看重点检查结构是否完整、Aurora 是否被正确定位、2022/2027 两阶段转型是否清楚、图是否可读。
查看任务原文
w1_t2独立可评分 workstream

市场规模模型

历史市场、未来五年预测和 2027 年转型情景,能否被交易团队持续更新?

Agent 要读取市场规模、鸡群、零售扫描、需求、成本、汇率和 WACC 等结构化与非结构化资料。
Agent 要交付可刷新 Excel 工作簿;需包含历史三年、预测五年、colony-to-barn 情景、Aurora 鸡群数据和敏感性分析。
Judge 要看重点检查公式可追溯、输入与输出分离、情景逻辑、需求/成本敏感性和数字一致性。
查看任务原文
w1_t3独立可评分 workstream

标的评估

Aurora 是否值得进入确认性尽调和 LOI 前的下一步决策?

Agent 要读取市场、竞争、消费者、投入成本、供应风险、副产品、替代用途和交易先例资料。
Agent 要交付投委会可使用的 CDD PowerPoint;需要把事实、争议、风险、机会和待验证问题连成判断框架。
Judge 要看重点检查论证是否有证据、是否区分事实与假设、是否覆盖商业和运营风险、是否提出可执行的 DD 问题。
查看任务原文
w1_t4独立可评分 workstream

高管简报视频

如何在很短时间内让高级交易发起人理解行业、Aurora 和最大知识缺口?

Agent 要读取同一套资料池,但交付必须适合口头叙事和字幕同步。
Agent 要交付短视频 + SRT 字幕;先讲供应链、母鸡生命周期、生产经济和副产品,再总结发现和确认性尽调问题。
Judge 要看重点检查叙事顺序、字幕同步、关键发现是否准确、是否明确区分已知信息与待验证事项。
查看任务原文
02 / 证据如何串成故事

同一资料池,四种阅读目的

四个任务共享同一套 50 个 shared 文件和 17 个 week 文件,但每个任务的叙事终点不同。先建立共同背景,再看任务如何重新排序证据。

市场事实行业规模、生产系统、零售集中度、消费者和监管给出外部边界。
目标事实IM、网站、内部简报、邮件和访谈提供 Aurora 的经营与交易假设。
执行风险HPAI、投入成本、许可、雏鸡、劳动力、包装和渠道揭示收益能否落地。
判断与交付任务说明、评分 rubric、traceability 和示例提交定义什么才算可用。
03 / 任务化阅读

从共同故事走向四个具体交付

w1_t1

任务一:先把市场画成一张可讨论的地图

任务原文中文翻译单独打开译文

目标

创建一份单页 LaTeX 文档,其中包含 TikZ 图示,用于描绘新西兰鸡蛋市场结构。该图将作为理解该行业生产系统和渠道的视觉辅助材料。

要求

  • 描绘新西兰鸡蛋市场结构。
  • 按生产系统细分生产商。
  • 按市场渠道细分。
  • 以视觉方式展示不同生产商在市场中的相对规模。
  • 清晰标注笼养禁令转型流向。
  • 端到端描绘价值链,并显示标的在其中的位置。识别相关中间环节。
  • 呈现对 Aurora 所处位置的生产商而言重要的跨阶段商业动态。
  • 在产量份额之外,以视觉方式区分具名生产商,反映结构性差异。

交付物

文件名: market_overview.tex 和 market_overview.pdf

这个任务不是单纯画图,而是把分散的行业事实压缩成一张交易团队可以共同讨论的结构图。Agent 需要先解释生产系统,再接上渠道和价值链,最后把 Aurora 放进市场中的相对位置。

任务叙事阅读顺序:行业结构与生产系统 → 生产者规模与竞争者 → 零售/foodservice 渠道 → 2022 与 2027 两阶段转型 → Aurora 的位置与关键商业动力。
为什么这样交付输出必须是单页 LaTeX/TikZ 与 PDF;评分关注图上是否同时呈现四类生产系统、相对规模、端到端价值链、中间商和 cage-free 转型,而不是只做一张好看的流程图。

本任务如何阅读材料

行业、市场与监管21 份证据

回答行业有多大、渠道如何分配、cage-free 转型由什么驱动,以及 HPAI、零售集中度和消费者趋势如何改变供需与风险。

在本任务中的用途用于决定市场地图上应出现哪些参与者、生产系统、渠道关系和转型节点。

两阶段转型:监管退出之后仍有商业期限

2022 年传统笼养退出是监管阶段;随后由主要零售商承诺推动的 2027 年非笼养货架转换,是第二个、更加商业化的期限。两者之间的错位造成了群养笼资产搁浅、短期供给收缩和价格溢价不确定性。

需求与价格:消费者愿望不等于支付意愿

健康观念、家庭预算、促销和替代蛋白共同影响鸡蛋需求。自由放养通常更受促销和价格弹性影响,平养与自由放养之间也存在明显替代,因此模型和投资判断都需要保留价格、销量与产品组合情景。

生物安全:一次疫情会穿透整个经营模型

HPAI 相关材料把扑杀、清洁、复养延迟、雏鸡补栏和额外生物安全成本串在一起。即使国家重新获得无疫状态,单场事件仍可能同时冲击供应、现金流、客户履约和转换计划。

访谈与一手判断13 份证据

把协会、行业专家、退休顾问、农场主和 foodservice broker 的口述判断放在一起;它们常常包含公开资料看不到的份额、成本、转换时点和执行难点,但必须区分观点与已验证事实。

在本任务中的用途用于决定市场地图上应出现哪些参与者、生产系统、渠道关系和转型节点。

再判断转型是否真的做得成

建设周期、资源许可、雏鸡供应、转换期间减产和价格溢价共同决定 colony-to-barn 计划能否按时完成。农场经营者的口述让工程计划从纸面资本开支变成可执行性问题。

交叉核对与补充证据

其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。

Aurora 与交易假设6 份证据

围绕目标公司的生产系统、客户、竞争位置、转换资本开支、副产品、替代用途和交易先例,帮助 Agent 把市场事实翻译成标的判断。

在本任务中的用途用于决定市场地图上应出现哪些参与者、生产系统、渠道关系和转型节点。

卖方故事:Aurora 为什么现在寻求交易

目标公司材料描述其品牌、客户、生产网络、产品组合和部分出售以支持转型资本开支的逻辑。阅读重点不是复述卖方亮点,而是识别哪些主张尚未被外部证据或经营数据验证。

价值创造:保住渠道、完成转换、改善组合

交易假设依赖 Aurora 保住主要零售客户,按时完成群养笼向平养等系统的转换,并让更高福利产品的价格溢价覆盖新增折旧、运营和融资成本。每一环都应转化为可检验的里程碑。

下行保护:竞争、供应链与替代用途

竞争格局、供应商暴露、可比交易和资产替代用途材料用于测试估值边界:当价格溢价、转型时间或客户留存低于预期时,是否仍有可承受的 EBITDA、资产价值和退出路径。

内部组织与流程19 份证据

解释 Halberd 的角色分工、合规、ESG、信息安全、模板、投委会流程和干扰性资料,测试 Agent 能否在真实机构约束下工作。

在本任务中的用途用于决定市场地图上应出现哪些参与者、生产系统、渠道关系和转型节点。

证据如何进入正式决策

分析标准、投委会模板和品牌规范要求区分事实、推断与待验证事项,并保留来源、假设和计算链。格式不是装饰,它决定了结论能否被审计和复用。

其他输入8 份证据

保留任务池中的配置或补充文件,避免 Agent 只挑选看起来最相关的材料。

在本任务中的用途用于决定市场地图上应出现哪些参与者、生产系统、渠道关系和转型节点。
查看英文任务原文
w1_t2

任务二:把故事变成可更新的数字模型

任务原文中文翻译单独打开译文

目标

开发一份全面的 Excel 工作簿,用于建模新西兰鸡蛋市场。该模型将为交易团队提供清晰的量化基础。请注意,随着尽调过程中出现新数据,交易团队将在未来几周继续使用并更新该模型。

要求

  • 构建一份交易团队可在新尽调数据到来时持续刷新的 Excel 工作簿。
  • 计算历史市场规模(回看 3 年)和 5 年预测。
  • 纳入殖民笼群体截至 2027 年底的笼养禁令转型情景。
  • 纳入 Aurora Eggs 的鸡群数据。
  • 在预测中反映消费者需求敏感性。
  • 保留影响承保期的成本侧投入成本和供给侧敏感性。

交付物

文件名: market_model.xlsx

这个任务承接市场地图,但不能依赖另一项任务的成品。Agent 要从原始资料中重新建立市场规模、鸡群、转换、价格、需求和成本输入,让交易团队可以在后续周次继续更新。

任务叙事阅读顺序:历史市场与鸡群基数 → 零售扫描与价格/促销 → 2027 转型情景 → Aurora 鸡群与产能 → 需求弹性、饲料/能源/包装等成本 → 汇率、WACC 和预测期。
为什么这样交付输出是可刷新 Excel;评分不只看最终数字,还看输入、公式、假设、情景和输出是否可审计,是否把不确定性显式放进模型。

本任务如何阅读材料

行业、市场与监管21 份证据

回答行业有多大、渠道如何分配、cage-free 转型由什么驱动,以及 HPAI、零售集中度和消费者趋势如何改变供需与风险。

在本任务中的用途用于把叙述转成可刷新模型中的输入、情景、公式和敏感性。

两阶段转型:监管退出之后仍有商业期限

2022 年传统笼养退出是监管阶段;随后由主要零售商承诺推动的 2027 年非笼养货架转换,是第二个、更加商业化的期限。两者之间的错位造成了群养笼资产搁浅、短期供给收缩和价格溢价不确定性。

需求与价格:消费者愿望不等于支付意愿

健康观念、家庭预算、促销和替代蛋白共同影响鸡蛋需求。自由放养通常更受促销和价格弹性影响,平养与自由放养之间也存在明显替代,因此模型和投资判断都需要保留价格、销量与产品组合情景。

生物安全:一次疫情会穿透整个经营模型

HPAI 相关材料把扑杀、清洁、复养延迟、雏鸡补栏和额外生物安全成本串在一起。即使国家重新获得无疫状态,单场事件仍可能同时冲击供应、现金流、客户履约和转换计划。

访谈与一手判断13 份证据

把协会、行业专家、退休顾问、农场主和 foodservice broker 的口述判断放在一起;它们常常包含公开资料看不到的份额、成本、转换时点和执行难点,但必须区分观点与已验证事实。

在本任务中的用途用于把叙述转成可刷新模型中的输入、情景、公式和敏感性。

再判断转型是否真的做得成

建设周期、资源许可、雏鸡供应、转换期间减产和价格溢价共同决定 colony-to-barn 计划能否按时完成。农场经营者的口述让工程计划从纸面资本开支变成可执行性问题。

交叉核对与补充证据

其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。

Aurora 与交易假设6 份证据

围绕目标公司的生产系统、客户、竞争位置、转换资本开支、副产品、替代用途和交易先例,帮助 Agent 把市场事实翻译成标的判断。

在本任务中的用途用于把叙述转成可刷新模型中的输入、情景、公式和敏感性。

卖方故事:Aurora 为什么现在寻求交易

目标公司材料描述其品牌、客户、生产网络、产品组合和部分出售以支持转型资本开支的逻辑。阅读重点不是复述卖方亮点,而是识别哪些主张尚未被外部证据或经营数据验证。

价值创造:保住渠道、完成转换、改善组合

交易假设依赖 Aurora 保住主要零售客户,按时完成群养笼向平养等系统的转换,并让更高福利产品的价格溢价覆盖新增折旧、运营和融资成本。每一环都应转化为可检验的里程碑。

下行保护:竞争、供应链与替代用途

竞争格局、供应商暴露、可比交易和资产替代用途材料用于测试估值边界:当价格溢价、转型时间或客户留存低于预期时,是否仍有可承受的 EBITDA、资产价值和退出路径。

内部组织与流程19 份证据

解释 Halberd 的角色分工、合规、ESG、信息安全、模板、投委会流程和干扰性资料,测试 Agent 能否在真实机构约束下工作。

在本任务中的用途用于把叙述转成可刷新模型中的输入、情景、公式和敏感性。

证据如何进入正式决策

分析标准、投委会模板和品牌规范要求区分事实、推断与待验证事项,并保留来源、假设和计算链。格式不是装饰,它决定了结论能否被审计和复用。

其他输入8 份证据

保留任务池中的配置或补充文件,避免 Agent 只挑选看起来最相关的材料。

在本任务中的用途用于把叙述转成可刷新模型中的输入、情景、公式和敏感性。
查看英文任务原文
w1_t3

任务三:把证据组织成投委会判断

任务原文中文翻译单独打开译文

目标

创建一份 PowerPoint 幻灯片,评估 Aurora Eggs 作为投资委员会潜在收购标的的情况。

要求

  • 产出一份具有实质内容、达到 CDD 水准的幻灯片。
  • 讨论标的在价值链中的竞争位置。
  • 讨论塑造 Aurora 风险与机会画像的消费者需求背景。
  • 讨论影响 Aurora 盈利持久性的投入侧成本和风险暴露。
  • 讨论影响该资产底线机会画像和盈利持久性的副产品经济、收入抵销以及任何替代用途选择权。

交付物

文件名: target_assessment.pptx

这个任务把“市场正在变化”转化为“这个标的是否值得继续尽调”。Agent 需要同时覆盖商业位置、消费者、投入端、经营韧性、副产品和替代用途,并把争议保留下来。

任务叙事阅读顺序:市场与竞争位置 → Aurora 的生产系统和转换执行 → 零售/foodservice 客户与需求 → 成本、生物安全和供应风险 → EBITDA 韧性、副产品与替代用途 → 交易先例与 confirmatory DD 问题。
为什么这样交付输出是 CDD 级 PowerPoint。好的 deck 应当让投资委员会看见事实、判断、风险、机会和下一步验证之间的连接,而不是把资料摘要简单拼接在一起。

本任务如何阅读材料

行业、市场与监管21 份证据

回答行业有多大、渠道如何分配、cage-free 转型由什么驱动,以及 HPAI、零售集中度和消费者趋势如何改变供需与风险。

在本任务中的用途用于形成投委会可挑战的事实、投资判断、风险和后续尽调问题。

两阶段转型:监管退出之后仍有商业期限

2022 年传统笼养退出是监管阶段;随后由主要零售商承诺推动的 2027 年非笼养货架转换,是第二个、更加商业化的期限。两者之间的错位造成了群养笼资产搁浅、短期供给收缩和价格溢价不确定性。

需求与价格:消费者愿望不等于支付意愿

健康观念、家庭预算、促销和替代蛋白共同影响鸡蛋需求。自由放养通常更受促销和价格弹性影响,平养与自由放养之间也存在明显替代,因此模型和投资判断都需要保留价格、销量与产品组合情景。

生物安全:一次疫情会穿透整个经营模型

HPAI 相关材料把扑杀、清洁、复养延迟、雏鸡补栏和额外生物安全成本串在一起。即使国家重新获得无疫状态,单场事件仍可能同时冲击供应、现金流、客户履约和转换计划。

访谈与一手判断13 份证据

把协会、行业专家、退休顾问、农场主和 foodservice broker 的口述判断放在一起;它们常常包含公开资料看不到的份额、成本、转换时点和执行难点,但必须区分观点与已验证事实。

在本任务中的用途用于形成投委会可挑战的事实、投资判断、风险和后续尽调问题。

再判断转型是否真的做得成

建设周期、资源许可、雏鸡供应、转换期间减产和价格溢价共同决定 colony-to-barn 计划能否按时完成。农场经营者的口述让工程计划从纸面资本开支变成可执行性问题。

交叉核对与补充证据

其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。

Aurora 与交易假设6 份证据

围绕目标公司的生产系统、客户、竞争位置、转换资本开支、副产品、替代用途和交易先例,帮助 Agent 把市场事实翻译成标的判断。

在本任务中的用途用于形成投委会可挑战的事实、投资判断、风险和后续尽调问题。

卖方故事:Aurora 为什么现在寻求交易

目标公司材料描述其品牌、客户、生产网络、产品组合和部分出售以支持转型资本开支的逻辑。阅读重点不是复述卖方亮点,而是识别哪些主张尚未被外部证据或经营数据验证。

价值创造:保住渠道、完成转换、改善组合

交易假设依赖 Aurora 保住主要零售客户,按时完成群养笼向平养等系统的转换,并让更高福利产品的价格溢价覆盖新增折旧、运营和融资成本。每一环都应转化为可检验的里程碑。

下行保护:竞争、供应链与替代用途

竞争格局、供应商暴露、可比交易和资产替代用途材料用于测试估值边界:当价格溢价、转型时间或客户留存低于预期时,是否仍有可承受的 EBITDA、资产价值和退出路径。

内部组织与流程19 份证据

解释 Halberd 的角色分工、合规、ESG、信息安全、模板、投委会流程和干扰性资料,测试 Agent 能否在真实机构约束下工作。

在本任务中的用途用于形成投委会可挑战的事实、投资判断、风险和后续尽调问题。

证据如何进入正式决策

分析标准、投委会模板和品牌规范要求区分事实、推断与待验证事项,并保留来源、假设和计算链。格式不是装饰,它决定了结论能否被审计和复用。

其他输入8 份证据

保留任务池中的配置或补充文件,避免 Agent 只挑选看起来最相关的材料。

在本任务中的用途用于形成投委会可挑战的事实、投资判断、风险和后续尽调问题。
查看英文任务原文
w1_t4

任务四:把复杂材料讲给高级交易发起人听

任务原文中文翻译单独打开译文

目标

制作一段短视频简报,并配套字幕,适合给高级交易发起人观看。该简报将综合初步评估中发现的最关键洞察和知识缺口。

要求

  • 开场包含入门说明,覆盖鸡蛋生产供应链的端到端流程、母鸡生命周期和生产经济性,以及影响 Aurora 底线画像的副产品 / 收入抵销经济性。
  • 总结关于 Aurora Eggs 和新西兰鸡蛋市场的初步发现。
  • 识别确认性尽职调查期间必须回答的开放问题。

交付物

文件名: briefing.mp4 和 briefing.srt

这个任务检验 Agent 能否在最短时间内建立共同语言。它必须先讲清楚鸡蛋供应链、母鸡生命周期、生产经济和副产品,再讲 Aurora 与新西兰市场,最后落到必须验证的关键问题。

任务叙事阅读顺序:供应链与生命周期 → 生产成本和副产品 → 市场转型与 Aurora → 最大机会与最大风险 → 需要 senior sponsor 决策或继续追问的 DD 问题。
为什么这样交付输出是短视频和同步字幕。评分关注叙事是否清楚、字幕是否准确、是否把事实与假设区分开,以及是否把复杂研究压缩成可行动的沟通。

本任务如何阅读材料

行业、市场与监管21 份证据

回答行业有多大、渠道如何分配、cage-free 转型由什么驱动,以及 HPAI、零售集中度和消费者趋势如何改变供需与风险。

在本任务中的用途用于筛选短视频中必须讲清的背景、关键张力和行动结论。

两阶段转型:监管退出之后仍有商业期限

2022 年传统笼养退出是监管阶段;随后由主要零售商承诺推动的 2027 年非笼养货架转换,是第二个、更加商业化的期限。两者之间的错位造成了群养笼资产搁浅、短期供给收缩和价格溢价不确定性。

需求与价格:消费者愿望不等于支付意愿

健康观念、家庭预算、促销和替代蛋白共同影响鸡蛋需求。自由放养通常更受促销和价格弹性影响,平养与自由放养之间也存在明显替代,因此模型和投资判断都需要保留价格、销量与产品组合情景。

生物安全:一次疫情会穿透整个经营模型

HPAI 相关材料把扑杀、清洁、复养延迟、雏鸡补栏和额外生物安全成本串在一起。即使国家重新获得无疫状态,单场事件仍可能同时冲击供应、现金流、客户履约和转换计划。

访谈与一手判断13 份证据

把协会、行业专家、退休顾问、农场主和 foodservice broker 的口述判断放在一起;它们常常包含公开资料看不到的份额、成本、转换时点和执行难点,但必须区分观点与已验证事实。

在本任务中的用途用于筛选短视频中必须讲清的背景、关键张力和行动结论。

再判断转型是否真的做得成

建设周期、资源许可、雏鸡供应、转换期间减产和价格溢价共同决定 colony-to-barn 计划能否按时完成。农场经营者的口述让工程计划从纸面资本开支变成可执行性问题。

交叉核对与补充证据

其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。

Aurora 与交易假设6 份证据

围绕目标公司的生产系统、客户、竞争位置、转换资本开支、副产品、替代用途和交易先例,帮助 Agent 把市场事实翻译成标的判断。

在本任务中的用途用于筛选短视频中必须讲清的背景、关键张力和行动结论。

卖方故事:Aurora 为什么现在寻求交易

目标公司材料描述其品牌、客户、生产网络、产品组合和部分出售以支持转型资本开支的逻辑。阅读重点不是复述卖方亮点,而是识别哪些主张尚未被外部证据或经营数据验证。

价值创造:保住渠道、完成转换、改善组合

交易假设依赖 Aurora 保住主要零售客户,按时完成群养笼向平养等系统的转换,并让更高福利产品的价格溢价覆盖新增折旧、运营和融资成本。每一环都应转化为可检验的里程碑。

下行保护:竞争、供应链与替代用途

竞争格局、供应商暴露、可比交易和资产替代用途材料用于测试估值边界:当价格溢价、转型时间或客户留存低于预期时,是否仍有可承受的 EBITDA、资产价值和退出路径。

内部组织与流程19 份证据

解释 Halberd 的角色分工、合规、ESG、信息安全、模板、投委会流程和干扰性资料,测试 Agent 能否在真实机构约束下工作。

在本任务中的用途用于筛选短视频中必须讲清的背景、关键张力和行动结论。

证据如何进入正式决策

分析标准、投委会模板和品牌规范要求区分事实、推断与待验证事项,并保留来源、假设和计算链。格式不是装饰,它决定了结论能否被审计和复用。

其他输入8 份证据

保留任务池中的配置或补充文件,避免 Agent 只挑选看起来最相关的材料。

在本任务中的用途用于筛选短视频中必须讲清的背景、关键张力和行动结论。
查看英文任务原文

评分链路

最终得分不是“说得像不像”,而是交付物是否逐项满足 rubric,并且能在提交内容中找到证据。

44A / 内容准确性检查关键事实、数字、结构和任务要求是否满足。
11C / 完整性检查必需模块、输出格式、章节、图表和问题是否缺失。
4AQ / 证据质量检查引用是否具体、可追溯,是否把事实和判断分开。
4P / 呈现质量检查文件是否专业、清楚、可读,适合真实工作场景。
任务说明→Agent 交付物→解析文本 / 图片 / 文件→二元 rubric 检查→汇总与成对比较
04 / 对照样本

同一任务,不同模型如何取舍

这些提交用于研究模型的工作方式,不计入排行榜。下面的评论依据仓库中实际交付物的结构与可见内容整理,不是官方评分;“页数、节点、公式、时长”只能帮助定位审阅重点,最终仍应逐项回到 rubric 和成品本身。

阅读方法先比较模型如何分配有限的页面或时间,再打开中文阅读版理解内容,最后查看原始成品验证视觉、公式、音画和可用性。
任务一:单页市场结构图比较的不是画面是否华丽,而是能否在一页中同时交代生产系统、竞争格局、价值链、渠道与转型逻辑。5 个模型样本

Claude 4 Opus Thinking

单页图 · 29 个 TikZ 节点

采用非常紧凑的单页图,节点数量在本组最少。

可借鉴信息层级容易被读者快速扫描。
重点复核紧凑也意味着容易漏掉中间商、产品系统差异或关键数字,需逐项对照 rubric。

Claude Fable 5

单页图 · 214 个 TikZ 节点

生成了本组最复杂、节点最密集的 TikZ 结构。

可借鉴覆盖面和显式标注空间较大,适合作为完整性上限的参照。
重点复核单页承载过多元素可能损害字号、阅读顺序和决策重点。

Gemini 3.1 Pro

单页图 · 47 个 TikZ 节点

在简洁版与高密度版之间取中间路线。

可借鉴结构复杂度较克制,较容易保留一页图的整体感。
重点复核需要检查克制是否以牺牲 Aurora 定位、规模数字或转型节点为代价。

GLM 5.2

单页图 · 77 个 TikZ 节点

以较多节点展开市场、价值链和交易背景。

可借鉴有空间把行业结构与目标公司放进同一张图。
重点复核内容量较高,需重点检查视觉拥挤、箭头关系和一页可读性。

GPT-5.5

单页图 · 81 个 TikZ 节点

节点数量较多,但源文件规模低于最密集样本。

可借鉴显示出在覆盖度与代码体量之间做压缩的取向。
重点复核仍需打开成品确认关键关系是否清楚,而不是只看节点数量判断质量。

注:o3 未提供任务一的对照提交。

任务二:可刷新市场模型重点观察工作表分工、公式链、输入来源、历史与预测衔接,以及转型和敏感性是否真的可以更新。6 个模型样本

Claude 4 Opus Thinking

7 张工作表 · 0 个公式单元

用七个工作表分别覆盖摘要、市场、产品组合、Aurora、转型、敏感性与假设。

可借鉴模块划分完整,读者容易找到主题。
重点复核工作簿 XML 未检测到公式,需重点确认它是否只是静态数值展示而非可刷新模型。

Claude Fable 5

4 张工作表 · 680 个公式单元

四张表形成假设、历史、预测和转型的紧凑计算链。

可借鉴检测到大量公式,刷新与审计属性较强。
重点复核需要确认 Aurora 专项、敏感性和开放问题是否在少量工作表内得到充分表达。

Gemini 3.1 Pro

4 张工作表 · 0 个公式单元

采用四张核心工作表,结构直观。

可借鉴输入、历史、预测和转型边界清楚。
重点复核工作簿 XML 未检测到公式,应复核预测与情景是否为硬编码结果。

GLM 5.2

10 张工作表 · 816 个公式单元

十张表覆盖封面、图例、市场、转型、敏感性、Aurora、利润池和开放问题。

可借鉴是本组模块与公式数量最丰富的样本,审阅路径最完整。
重点复核复杂度也最高,需要检查重复输入、公式一致性和后续维护成本。

GPT-5.5

4 张工作表 · 449 个公式单元

用四张表构建聚焦的假设、历史、预测和转型模型。

可借鉴保留了可刷新公式,并显式呈现 top-down 与 bottom-up 口径差异。
重点复核紧凑结构可能把 Aurora、成本敏感性和审计说明压进同一层级,需细查覆盖度。

o3

6 张工作表 · 104 个公式单元

六张表覆盖输入、预测、转型、敏感性、Aurora 和说明。

可借鉴模块命名直接,便于交易团队顺序阅读。
重点复核公式量明显低于其他可计算样本,需要确认关键年份和情景没有过多硬编码。
任务三:目标公司评估 Deck页数只代表信息容量;真正要比较的是事实、判断、风险、价值创造与确认性尽调问题是否形成投委会叙事。6 个模型样本

Claude 4 Opus Thinking

11 页投委会材料

以 11 页完成相对精简的目标评估。

可借鉴适合快速形成投委会初读和讨论框架。
重点复核需检查较短篇幅是否完整覆盖消费者、成本、生物安全、副产品和确认性尽调。

Claude Fable 5

19 页投委会材料

19 页,接近完整 IC pre-read 的展开方式。

可借鉴能够为证据、风险和开放问题留出独立页面。
重点复核需要防止研究材料堆叠,确保每页都有明确的判断句和决策意义。

Gemini 3.1 Pro

7 页投委会材料

七页,是本组最短的 Deck。

可借鉴观点可能更集中,适合高级读者快速浏览。
重点复核篇幅很短,完整性与证据可追溯性是最需要复核的风险。

GLM 5.2

25 页投委会材料

25 页,是本组最长的目标评估。

可借鉴为行业、目标、风险、情景和尽调问题提供了最大展开空间。
重点复核需检查是否超过 pre-LOI 阶段所需深度,以及结论是否被大量页面稀释。

GPT-5.5

17 页投委会材料

17 页,位于精简版与长篇版之间。

可借鉴具备形成完整投资叙事的容量,同时仍可控制阅读负担。
重点复核应核对数字来源、货币口径和每项判断对应的 confirmatory DD 动作。

o3

9 页投委会材料

九页,采用较短的管理层式评估。

可借鉴阅读成本低,容易看出作者选择的核心问题。
重点复核需检查价值链、替代用途和量化风险是否因篇幅限制而缺失。
任务四:高级发起人视频简报时长和字幕密度能够提示取舍风格,但仍需回到视频检查音画同步、视觉变化,以及 primer、三项发现和三项开放问题是否齐全。6 个模型样本

Claude 4 Opus Thinking

35 秒 · 7 条字幕

视频约 35 秒、七条字幕,极度压缩。

可借鉴适合观察模型如何选择最少的信息点。
重点复核很难在如此短的时长内充分覆盖业务 primer、三项发现和三项具体尽调问题。

Claude Fable 5

8 分 28 秒 · 49 条字幕

视频约 8 分 29 秒、49 条字幕,叙述最为展开。

可借鉴有足够时间解释行业机制、目标风险和知识缺口。
重点复核需要检查是否仍然符合“短视频简报”的高级管理层使用场景,并避免信息过载。

Gemini 3.1 Pro

2 分 23 秒 · 24 条字幕

视频约 2 分 23 秒、24 条字幕,节奏较快。

可借鉴在短时长内仍保留了分段表达空间。
重点复核需重点检查 primer 的三根支柱和具体证据是否被过度压缩。

GLM 5.2

9 分 48 秒 · 34 条字幕

视频约 9 分 48 秒、34 条字幕,是本组最长样本。

可借鉴可以完整讲述背景和风险链条。
重点复核字幕块可能偏长,且长时长需要更强的视觉变化与叙事纪律。

GPT-5.5

7 分 13 秒 · 37 条字幕

视频约 7 分 14 秒、37 条字幕,采用较完整的交易简报长度。

可借鉴有条件兼顾业务 primer、发现和开放问题。
重点复核需检查内容取舍、美元口径以及字幕与音频逐字同步。

o3

1 分 30 秒 · 9 条字幕

视频约 90 秒、九条字幕,属于高度浓缩版本。

可借鉴核心观点容易被快速传达。
重点复核字幕颗粒较粗,且较短时长可能不足以呈现全部结构和具体证据。

资料池与原始入口

这里按“资料在评测中扮演的角色”分组。文件名本身是链接:点击文件名打开原始文件,点击“中文阅读版”打开对应的本地中文页面。

先读这里说明角色、交易阶段、行业背景、周次目标和整体工作上下文。2 个文件入口
四个交付任务规定每个 workstream 的目标、输入边界、交付格式和必须回答的问题。4 个文件入口
长期背景整个项目可用的行业、公司、监管、消费者、内部流程和组织材料。130 个文件入口
本周证据本周任务专属材料,通常包含邮件、访谈、内部简报和交易团队工作文件。17 个文件入口
评测运行方式告诉 agent 如何工作、如何提交文件,以及 judge 如何接收交付物。4 个文件入口
评分依据二元检查、成对比较、rubric、source graph 和 traceability 数据。3 个文件入口
对照样本不同模型已经生成的图、模型、deck、视频和字幕,仅用于研究,不计入排行榜。33 个文件入口
仓库配置版本控制和数据集级别的配置文件。4 个文件入口