00 / 基准导言
为什么要把模型放进一只“工作公文包”
短问答可以检验模型是否知道一个答案,却很难说明它能否接手一段真实工作。Artificial Analysis 在 2026 年 6 月推出 AA-Briefcase,就是要把评测对象从“回答问题”推进到“完成项目”:Agent 要在大量零散、冲突且跨格式的材料中找到证据,理解机构背景和隐含要求,完成可计算、可审阅、可继续使用的专业交付物。
从单题推理到连续项目完整基准包含数据科学、产品管理、银行运营和重工业战略四个保密的多周项目,共 91 个任务。任务按周共享机构语境,但当前每个任务仍独立运行,不继承模型之前的成品。
从长上下文到上下文治理完整基准共有近 2,000 份源文件,涵盖文档、表格、演示、数据导出等多种格式。邮件与 Slack 是其中两类导出材料;展开这些导出文件后,可读到 3,500 多封邮件和 25,000 条 Slack 消息。前者是文件层计数,后两者是消息层计数,不能直接相加。
从漂亮答案到可用交付模型要制作财务模型、董事会演示、设计稿等真实文件。评测同时检查事实与要求是否逐项满足、分析是否严谨、呈现是否专业,避免把“看起来不错”误判成“工作已经完成”。
4保密多周项目
91专业任务
近 2,000源文件(文件层)
3,500+邮件(消息层)
25,000Slack 消息(消息层)
完成度,而不是分数“完成一个任务”意味着全部要求同时成立
这里把严格完成定义为:一个任务的所有二元 rubric 条件都通过。它不同于平均 rubric 通过率,也不同于分析质量、呈现质量或综合 Elo;一个模型即使完成了多数局部要求,只要还漏掉一项隐藏要求、证据链、公式或文件规范,就不能算严格完成。
截至 2026-07-14
前沿模型的官方完成披露(历史快照)
下表不展示 Elo 或平均通过率。除 Fable 5 外,官方公开页没有逐模型发布“全部 rubric 条件通过的任务占比”;因此只能确认这些模型已被纳入截至该日期的结果,不能据排行榜分数反推严格完成率,也不能断言每次运行都产出了 91 项可用交付。
模型评测状态严格完成率公开信息
Claude Fable 5已纳入截至该日期的官方评测3%官方明确披露:仅 3% 的任务通过了全部 rubric 条件。
GPT-5.6 Sol(max)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。
Claude Sonnet 5(max)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。
Claude Opus 4.8(max)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。
Grok 4.5(high)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。
Claude Opus 4.7(max)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。
GLM-5.2(max)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。
GPT-5.5(xhigh)已纳入截至该日期的官方评测未单列截至该日期,官方结果页已收录该模型,但未公布严格全项完成率。
截至 2026-07-14,官方结果页收录 46 个模型;此处聚焦截至该日期的结果中的代表性前沿配置,不把榜单名次或 Elo 当作任务完成度。
阅读边界后面的材料只是一份公开样本
AA-Briefcase-Lite 是第 5 个公开场景中的一周:它用虚构的 Halberd 与 Aurora 交易、真实的新西兰蛋品市场数据以及刻意设置的跨来源冲突,展示场景上下文、资料结构、任务、评分和提交长什么样。它规模更小、难度更低,不进入官方排行榜,也不是四个保密项目的缩略成绩单。
这份样本包含1 周尽调故事67 个来源 / 147 个文件4 个独立交付63 项检查
正式 AA-Briefcase91 个任务4 个保密多周项目,构成官方评测结果
对比
后文 AA-Briefcase-Lite4 个任务1 个公开场景中的 1 周,仅作结构演示
Lite 的任务数约为正式基准的 4.4%。这只是数量对比:Lite 本身更小、难度更低,不能把它理解为正式基准按 4.4% 等比例抽样,也不能用后文样本提交推断模型在 91 个正式任务上的完成度。
仅检查文件是否存在
本地 Lite 样本的交付完整度
这里的 4/4 只表示仓库里四项任务都有提交文件,不表示内容正确、rubric 通过或任务完成。后文会逐任务展开这些提交的做法和局限。
Claude 4 Opus Thinking任务 1有交付任务 2有交付任务 3有交付任务 4有交付
4/4 Claude Fable 5任务 1有交付任务 2有交付任务 3有交付任务 4仅字幕
4/4 Gemini 3.1 Pro任务 1有交付任务 2有交付任务 3有交付任务 4有交付
4/4 GLM 5.2任务 1有交付任务 2有交付任务 3有交付任务 4有交付
4/4 GPT-5.5任务 1有交付任务 2有交付任务 3有交付任务 4有交付
4/4 o3任务 1缺交付任务 2有交付任务 3有交付任务 4有交付
3/4
01 / 故事背景
一项跨太平洋蛋白平台交易,为什么需要四种不同的 Agent 工作?
AA-Briefcase-Lite 把 Agent 放进一个接近真实交易团队的工作现场:Halberd Capital Partners 正在评估新西兰私人蛋鸡生产商 Aurora Eggs,作为北美农业食品平台的跨太平洋 tuck-in。交易尚处于 pre-LOI / indicative-bid prep,团队要的是 outside-in 初步判断,而不是未经验证的最终投资结论。
A交易从哪里开始
Halberd 已有北美农业食品平台,Sector Partner 认为 Aurora 可能带来跨区域协同。但 Aurora 是私人公司,公开市场资料看不见它的完整份额、客户和盈利结构,因此必须把公开资料、访谈、内部文件和卖方材料拼起来。
B行业正在发生什么
新西兰蛋鸡行业经历两阶段转型:第一阶段在 2022 年底前退出传统 battery cage;第二阶段由 Foodstuffs、Woolworths NZ 等零售商推动,要求包装壳蛋逐步转向 cage-free。监管要求、零售承诺、消费者压力和供给转换节奏并不完全相同。
CAurora 的核心矛盾
Aurora 被描述为按产量计的 #2 生产商,生产组合中 colony-cage 暴露较高。价值机会在于保住主要零售渠道并完成 colony-to-barn 转换;主要风险在于资本开支、资源许可、雏鸡供应、转换期间的产量损失、价格溢价压缩和执行时点。
D为什么不能只看一个答案
材料刻意混合了行业报告、专家访谈、Slack、邮件、内部政策、无关组合公司董事会材料和不同模型的示例提交。Agent 必须判断哪一份材料回答哪个问题,识别噪声和冲突,并把“已知、推断、待验证”分开。
2022传统笼养退出的监管阶段完成
2024-25H7N6 生物安全事件带来额外成本与延迟
2025-26市场处于零售承诺、转换和价格重估阶段
2027主要零售商承诺推动 cage-free 货架转换
下一步确认 Aurora 的转换执行、收益和风险
02 / 证据如何串成故事
同一资料池,四种阅读目的
四个任务共享同一套 50 个 shared 文件和 17 个 week 文件,但每个任务的叙事终点不同。先建立共同背景,再看任务如何重新排序证据。
市场事实行业规模、生产系统、零售集中度、消费者和监管给出外部边界。
目标事实IM、网站、内部简报、邮件和访谈提供 Aurora 的经营与交易假设。
执行风险HPAI、投入成本、许可、雏鸡、劳动力、包装和渠道揭示收益能否落地。
判断与交付任务说明、评分 rubric、traceability 和示例提交定义什么才算可用。
03 / 任务化阅读
从共同故事走向四个具体交付
w1_t1
任务一:先把市场画成一张可讨论的地图
目标
创建一份单页 LaTeX 文档,其中包含 TikZ 图示,用于描绘新西兰鸡蛋市场结构。该图将作为理解该行业生产系统和渠道的视觉辅助材料。
要求
- 描绘新西兰鸡蛋市场结构。
- 按生产系统细分生产商。
- 按市场渠道细分。
- 以视觉方式展示不同生产商在市场中的相对规模。
- 清晰标注笼养禁令转型流向。
- 端到端描绘价值链,并显示标的在其中的位置。识别相关中间环节。
- 呈现对 Aurora 所处位置的生产商而言重要的跨阶段商业动态。
- 在产量份额之外,以视觉方式区分具名生产商,反映结构性差异。
交付物
文件名: market_overview.tex 和 market_overview.pdf
这个任务不是单纯画图,而是把分散的行业事实压缩成一张交易团队可以共同讨论的结构图。Agent 需要先解释生产系统,再接上渠道和价值链,最后把 Aurora 放进市场中的相对位置。
任务叙事阅读顺序:行业结构与生产系统 → 生产者规模与竞争者 → 零售/foodservice 渠道 → 2022 与 2027 两阶段转型 → Aurora 的位置与关键商业动力。
为什么这样交付输出必须是单页 LaTeX/TikZ 与 PDF;评分关注图上是否同时呈现四类生产系统、相对规模、端到端价值链、中间商和 cage-free 转型,而不是只做一张好看的流程图。
本任务如何阅读材料
行业、市场与监管21 份证据
回答行业有多大、渠道如何分配、cage-free 转型由什么驱动,以及 HPAI、零售集中度和消费者趋势如何改变供需与风险。
在本任务中的用途用于决定市场地图上应出现哪些参与者、生产系统、渠道关系和转型节点。
行业底盘:谁在生产、用什么系统生产
先建立蛋鸡存栏、主要生产商和传统笼养、群养笼、平养、自由放养四类系统的共同语言。材料显示这是一个集中度不低、但公开口径并不完全一致的市场;Aurora 的相对位置必须通过多源交叉验证。
渠道权力:零售集中决定转型节奏
新西兰杂货零售高度集中,Foodstuffs 与 Woolworths 的采购政策会直接改变生产商的货架准入、包装蛋组合和资本开支时点。零售份额变化也解释了为什么不能把总消费量简单等同于 Aurora 的可服务市场。
两阶段转型:监管退出之后仍有商业期限
2022 年传统笼养退出是监管阶段;随后由主要零售商承诺推动的 2027 年非笼养货架转换,是第二个、更加商业化的期限。两者之间的错位造成了群养笼资产搁浅、短期供给收缩和价格溢价不确定性。
需求与价格:消费者愿望不等于支付意愿
健康观念、家庭预算、促销和替代蛋白共同影响鸡蛋需求。自由放养通常更受促销和价格弹性影响,平养与自由放养之间也存在明显替代,因此模型和投资判断都需要保留价格、销量与产品组合情景。
生物安全:一次疫情会穿透整个经营模型
HPAI 相关材料把扑杀、清洁、复养延迟、雏鸡补栏和额外生物安全成本串在一起。即使国家重新获得无疫状态,单场事件仍可能同时冲击供应、现金流、客户履约和转换计划。
交叉核对与补充证据
其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。
访谈与一手判断13 份证据
把协会、行业专家、退休顾问、农场主和 foodservice broker 的口述判断放在一起;它们常常包含公开资料看不到的份额、成本、转换时点和执行难点,但必须区分观点与已验证事实。
在本任务中的用途用于决定市场地图上应出现哪些参与者、生产系统、渠道关系和转型节点。
先拼出市场与 Aurora 的隐形轮廓
行业专家首先补足公开资料缺失的生产商排序、份额、产品结构、客户集中度以及 Aurora 的收入和 EBITDA 轮廓。这些数字适合形成初始假设,但仍应标记为访谈判断并等待数据室验证。
再判断转型是否真的做得成
建设周期、资源许可、雏鸡供应、转换期间减产和价格溢价共同决定 colony-to-barn 计划能否按时完成。农场经营者的口述让工程计划从纸面资本开支变成可执行性问题。
沿价值链追问利润最后留在哪里
渠道访谈和价值链讨论用于拆解饲料、包装、零售自有品牌与 foodservice 中间环节的议价权,帮助区分行业收入增长与生产商实际利润改善。
把需求、成本和下行情景放进同一张图
后续访谈覆盖消费降级、替代品、竞争者、交易先例、投入成本、生物安全和资产替代用途。它们共同回答:基本情景失效时,Aurora 的盈利和资产价值还有多少缓冲。
交叉核对与补充证据
其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。
Aurora 与交易假设6 份证据
围绕目标公司的生产系统、客户、竞争位置、转换资本开支、副产品、替代用途和交易先例,帮助 Agent 把市场事实翻译成标的判断。
在本任务中的用途用于决定市场地图上应出现哪些参与者、生产系统、渠道关系和转型节点。
卖方故事:Aurora 为什么现在寻求交易
目标公司材料描述其品牌、客户、生产网络、产品组合和部分出售以支持转型资本开支的逻辑。阅读重点不是复述卖方亮点,而是识别哪些主张尚未被外部证据或经营数据验证。
价值创造:保住渠道、完成转换、改善组合
交易假设依赖 Aurora 保住主要零售客户,按时完成群养笼向平养等系统的转换,并让更高福利产品的价格溢价覆盖新增折旧、运营和融资成本。每一环都应转化为可检验的里程碑。
下行保护:竞争、供应链与替代用途
竞争格局、供应商暴露、可比交易和资产替代用途材料用于测试估值边界:当价格溢价、转型时间或客户留存低于预期时,是否仍有可承受的 EBITDA、资产价值和退出路径。
内部组织与流程19 份证据
解释 Halberd 的角色分工、合规、ESG、信息安全、模板、投委会流程和干扰性资料,测试 Agent 能否在真实机构约束下工作。
在本任务中的用途用于决定市场地图上应出现哪些参与者、生产系统、渠道关系和转型节点。
谁负责判断,谁负责挑战
组织图和项目流程明确 Sector Partner、交易团队、运营、ESG、合规和投委会之间的分工。Agent 的输出不是孤立研究报告,而是要能被不同角色复核、质询并继续推进。
证据如何进入正式决策
分析标准、投委会模板和品牌规范要求区分事实、推断与待验证事项,并保留来源、假设和计算链。格式不是装饰,它决定了结论能否被审计和复用。
真实机构约束:合规、ESG 与信息安全
跨境农业交易还要满足利益冲突、动物福利、环境、数据处理和保密要求。优秀输出应把这些约束嵌入工作过程,而不是只在末页列一组免责声明。
噪声筛选也是评测的一部分
材料池刻意混入其他组合公司、差旅和文化活动等内部文件。它们测试 Agent 是否能解释排除理由,而不是因为文件来自内部就一律纳入交易结论。
交叉核对与补充证据
其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。
其他输入8 份证据
保留任务池中的配置或补充文件,避免 Agent 只挑选看起来最相关的材料。
在本任务中的用途用于决定市场地图上应出现哪些参与者、生产系统、渠道关系和转型节点。
补充材料:用于校准,而不是主导结论
这些配置、说明或跨主题材料用于补齐任务边界、核对口径和检查遗漏。它们应在需要时进入证据链,但不应取代更直接的市场、目标公司和一手访谈证据。
查看英文任务原文w1_t2
任务二:把故事变成可更新的数字模型
目标
开发一份全面的 Excel 工作簿,用于建模新西兰鸡蛋市场。该模型将为交易团队提供清晰的量化基础。请注意,随着尽调过程中出现新数据,交易团队将在未来几周继续使用并更新该模型。
要求
- 构建一份交易团队可在新尽调数据到来时持续刷新的 Excel 工作簿。
- 计算历史市场规模(回看 3 年)和 5 年预测。
- 纳入殖民笼群体截至 2027 年底的笼养禁令转型情景。
- 纳入 Aurora Eggs 的鸡群数据。
- 在预测中反映消费者需求敏感性。
- 保留影响承保期的成本侧投入成本和供给侧敏感性。
交付物
文件名: market_model.xlsx
这个任务承接市场地图,但不能依赖另一项任务的成品。Agent 要从原始资料中重新建立市场规模、鸡群、转换、价格、需求和成本输入,让交易团队可以在后续周次继续更新。
任务叙事阅读顺序:历史市场与鸡群基数 → 零售扫描与价格/促销 → 2027 转型情景 → Aurora 鸡群与产能 → 需求弹性、饲料/能源/包装等成本 → 汇率、WACC 和预测期。
为什么这样交付输出是可刷新 Excel;评分不只看最终数字,还看输入、公式、假设、情景和输出是否可审计,是否把不确定性显式放进模型。
本任务如何阅读材料
行业、市场与监管21 份证据
回答行业有多大、渠道如何分配、cage-free 转型由什么驱动,以及 HPAI、零售集中度和消费者趋势如何改变供需与风险。
在本任务中的用途用于把叙述转成可刷新模型中的输入、情景、公式和敏感性。
行业底盘:谁在生产、用什么系统生产
先建立蛋鸡存栏、主要生产商和传统笼养、群养笼、平养、自由放养四类系统的共同语言。材料显示这是一个集中度不低、但公开口径并不完全一致的市场;Aurora 的相对位置必须通过多源交叉验证。
渠道权力:零售集中决定转型节奏
新西兰杂货零售高度集中,Foodstuffs 与 Woolworths 的采购政策会直接改变生产商的货架准入、包装蛋组合和资本开支时点。零售份额变化也解释了为什么不能把总消费量简单等同于 Aurora 的可服务市场。
两阶段转型:监管退出之后仍有商业期限
2022 年传统笼养退出是监管阶段;随后由主要零售商承诺推动的 2027 年非笼养货架转换,是第二个、更加商业化的期限。两者之间的错位造成了群养笼资产搁浅、短期供给收缩和价格溢价不确定性。
需求与价格:消费者愿望不等于支付意愿
健康观念、家庭预算、促销和替代蛋白共同影响鸡蛋需求。自由放养通常更受促销和价格弹性影响,平养与自由放养之间也存在明显替代,因此模型和投资判断都需要保留价格、销量与产品组合情景。
生物安全:一次疫情会穿透整个经营模型
HPAI 相关材料把扑杀、清洁、复养延迟、雏鸡补栏和额外生物安全成本串在一起。即使国家重新获得无疫状态,单场事件仍可能同时冲击供应、现金流、客户履约和转换计划。
交叉核对与补充证据
其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。
访谈与一手判断13 份证据
把协会、行业专家、退休顾问、农场主和 foodservice broker 的口述判断放在一起;它们常常包含公开资料看不到的份额、成本、转换时点和执行难点,但必须区分观点与已验证事实。
在本任务中的用途用于把叙述转成可刷新模型中的输入、情景、公式和敏感性。
先拼出市场与 Aurora 的隐形轮廓
行业专家首先补足公开资料缺失的生产商排序、份额、产品结构、客户集中度以及 Aurora 的收入和 EBITDA 轮廓。这些数字适合形成初始假设,但仍应标记为访谈判断并等待数据室验证。
再判断转型是否真的做得成
建设周期、资源许可、雏鸡供应、转换期间减产和价格溢价共同决定 colony-to-barn 计划能否按时完成。农场经营者的口述让工程计划从纸面资本开支变成可执行性问题。
沿价值链追问利润最后留在哪里
渠道访谈和价值链讨论用于拆解饲料、包装、零售自有品牌与 foodservice 中间环节的议价权,帮助区分行业收入增长与生产商实际利润改善。
把需求、成本和下行情景放进同一张图
后续访谈覆盖消费降级、替代品、竞争者、交易先例、投入成本、生物安全和资产替代用途。它们共同回答:基本情景失效时,Aurora 的盈利和资产价值还有多少缓冲。
交叉核对与补充证据
其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。
Aurora 与交易假设6 份证据
围绕目标公司的生产系统、客户、竞争位置、转换资本开支、副产品、替代用途和交易先例,帮助 Agent 把市场事实翻译成标的判断。
在本任务中的用途用于把叙述转成可刷新模型中的输入、情景、公式和敏感性。
卖方故事:Aurora 为什么现在寻求交易
目标公司材料描述其品牌、客户、生产网络、产品组合和部分出售以支持转型资本开支的逻辑。阅读重点不是复述卖方亮点,而是识别哪些主张尚未被外部证据或经营数据验证。
价值创造:保住渠道、完成转换、改善组合
交易假设依赖 Aurora 保住主要零售客户,按时完成群养笼向平养等系统的转换,并让更高福利产品的价格溢价覆盖新增折旧、运营和融资成本。每一环都应转化为可检验的里程碑。
下行保护:竞争、供应链与替代用途
竞争格局、供应商暴露、可比交易和资产替代用途材料用于测试估值边界:当价格溢价、转型时间或客户留存低于预期时,是否仍有可承受的 EBITDA、资产价值和退出路径。
内部组织与流程19 份证据
解释 Halberd 的角色分工、合规、ESG、信息安全、模板、投委会流程和干扰性资料,测试 Agent 能否在真实机构约束下工作。
在本任务中的用途用于把叙述转成可刷新模型中的输入、情景、公式和敏感性。
谁负责判断,谁负责挑战
组织图和项目流程明确 Sector Partner、交易团队、运营、ESG、合规和投委会之间的分工。Agent 的输出不是孤立研究报告,而是要能被不同角色复核、质询并继续推进。
证据如何进入正式决策
分析标准、投委会模板和品牌规范要求区分事实、推断与待验证事项,并保留来源、假设和计算链。格式不是装饰,它决定了结论能否被审计和复用。
真实机构约束:合规、ESG 与信息安全
跨境农业交易还要满足利益冲突、动物福利、环境、数据处理和保密要求。优秀输出应把这些约束嵌入工作过程,而不是只在末页列一组免责声明。
噪声筛选也是评测的一部分
材料池刻意混入其他组合公司、差旅和文化活动等内部文件。它们测试 Agent 是否能解释排除理由,而不是因为文件来自内部就一律纳入交易结论。
交叉核对与补充证据
其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。
其他输入8 份证据
保留任务池中的配置或补充文件,避免 Agent 只挑选看起来最相关的材料。
在本任务中的用途用于把叙述转成可刷新模型中的输入、情景、公式和敏感性。
补充材料:用于校准,而不是主导结论
这些配置、说明或跨主题材料用于补齐任务边界、核对口径和检查遗漏。它们应在需要时进入证据链,但不应取代更直接的市场、目标公司和一手访谈证据。
查看英文任务原文w1_t3
任务三:把证据组织成投委会判断
目标
创建一份 PowerPoint 幻灯片,评估 Aurora Eggs 作为投资委员会潜在收购标的的情况。
要求
- 产出一份具有实质内容、达到 CDD 水准的幻灯片。
- 讨论标的在价值链中的竞争位置。
- 讨论塑造 Aurora 风险与机会画像的消费者需求背景。
- 讨论影响 Aurora 盈利持久性的投入侧成本和风险暴露。
- 讨论影响该资产底线机会画像和盈利持久性的副产品经济、收入抵销以及任何替代用途选择权。
交付物
文件名: target_assessment.pptx
这个任务把“市场正在变化”转化为“这个标的是否值得继续尽调”。Agent 需要同时覆盖商业位置、消费者、投入端、经营韧性、副产品和替代用途,并把争议保留下来。
任务叙事阅读顺序:市场与竞争位置 → Aurora 的生产系统和转换执行 → 零售/foodservice 客户与需求 → 成本、生物安全和供应风险 → EBITDA 韧性、副产品与替代用途 → 交易先例与 confirmatory DD 问题。
为什么这样交付输出是 CDD 级 PowerPoint。好的 deck 应当让投资委员会看见事实、判断、风险、机会和下一步验证之间的连接,而不是把资料摘要简单拼接在一起。
本任务如何阅读材料
行业、市场与监管21 份证据
回答行业有多大、渠道如何分配、cage-free 转型由什么驱动,以及 HPAI、零售集中度和消费者趋势如何改变供需与风险。
在本任务中的用途用于形成投委会可挑战的事实、投资判断、风险和后续尽调问题。
行业底盘:谁在生产、用什么系统生产
先建立蛋鸡存栏、主要生产商和传统笼养、群养笼、平养、自由放养四类系统的共同语言。材料显示这是一个集中度不低、但公开口径并不完全一致的市场;Aurora 的相对位置必须通过多源交叉验证。
渠道权力:零售集中决定转型节奏
新西兰杂货零售高度集中,Foodstuffs 与 Woolworths 的采购政策会直接改变生产商的货架准入、包装蛋组合和资本开支时点。零售份额变化也解释了为什么不能把总消费量简单等同于 Aurora 的可服务市场。
两阶段转型:监管退出之后仍有商业期限
2022 年传统笼养退出是监管阶段;随后由主要零售商承诺推动的 2027 年非笼养货架转换,是第二个、更加商业化的期限。两者之间的错位造成了群养笼资产搁浅、短期供给收缩和价格溢价不确定性。
需求与价格:消费者愿望不等于支付意愿
健康观念、家庭预算、促销和替代蛋白共同影响鸡蛋需求。自由放养通常更受促销和价格弹性影响,平养与自由放养之间也存在明显替代,因此模型和投资判断都需要保留价格、销量与产品组合情景。
生物安全:一次疫情会穿透整个经营模型
HPAI 相关材料把扑杀、清洁、复养延迟、雏鸡补栏和额外生物安全成本串在一起。即使国家重新获得无疫状态,单场事件仍可能同时冲击供应、现金流、客户履约和转换计划。
交叉核对与补充证据
其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。
访谈与一手判断13 份证据
把协会、行业专家、退休顾问、农场主和 foodservice broker 的口述判断放在一起;它们常常包含公开资料看不到的份额、成本、转换时点和执行难点,但必须区分观点与已验证事实。
在本任务中的用途用于形成投委会可挑战的事实、投资判断、风险和后续尽调问题。
先拼出市场与 Aurora 的隐形轮廓
行业专家首先补足公开资料缺失的生产商排序、份额、产品结构、客户集中度以及 Aurora 的收入和 EBITDA 轮廓。这些数字适合形成初始假设,但仍应标记为访谈判断并等待数据室验证。
再判断转型是否真的做得成
建设周期、资源许可、雏鸡供应、转换期间减产和价格溢价共同决定 colony-to-barn 计划能否按时完成。农场经营者的口述让工程计划从纸面资本开支变成可执行性问题。
沿价值链追问利润最后留在哪里
渠道访谈和价值链讨论用于拆解饲料、包装、零售自有品牌与 foodservice 中间环节的议价权,帮助区分行业收入增长与生产商实际利润改善。
把需求、成本和下行情景放进同一张图
后续访谈覆盖消费降级、替代品、竞争者、交易先例、投入成本、生物安全和资产替代用途。它们共同回答:基本情景失效时,Aurora 的盈利和资产价值还有多少缓冲。
交叉核对与补充证据
其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。
Aurora 与交易假设6 份证据
围绕目标公司的生产系统、客户、竞争位置、转换资本开支、副产品、替代用途和交易先例,帮助 Agent 把市场事实翻译成标的判断。
在本任务中的用途用于形成投委会可挑战的事实、投资判断、风险和后续尽调问题。
卖方故事:Aurora 为什么现在寻求交易
目标公司材料描述其品牌、客户、生产网络、产品组合和部分出售以支持转型资本开支的逻辑。阅读重点不是复述卖方亮点,而是识别哪些主张尚未被外部证据或经营数据验证。
价值创造:保住渠道、完成转换、改善组合
交易假设依赖 Aurora 保住主要零售客户,按时完成群养笼向平养等系统的转换,并让更高福利产品的价格溢价覆盖新增折旧、运营和融资成本。每一环都应转化为可检验的里程碑。
下行保护:竞争、供应链与替代用途
竞争格局、供应商暴露、可比交易和资产替代用途材料用于测试估值边界:当价格溢价、转型时间或客户留存低于预期时,是否仍有可承受的 EBITDA、资产价值和退出路径。
内部组织与流程19 份证据
解释 Halberd 的角色分工、合规、ESG、信息安全、模板、投委会流程和干扰性资料,测试 Agent 能否在真实机构约束下工作。
在本任务中的用途用于形成投委会可挑战的事实、投资判断、风险和后续尽调问题。
谁负责判断,谁负责挑战
组织图和项目流程明确 Sector Partner、交易团队、运营、ESG、合规和投委会之间的分工。Agent 的输出不是孤立研究报告,而是要能被不同角色复核、质询并继续推进。
证据如何进入正式决策
分析标准、投委会模板和品牌规范要求区分事实、推断与待验证事项,并保留来源、假设和计算链。格式不是装饰,它决定了结论能否被审计和复用。
真实机构约束:合规、ESG 与信息安全
跨境农业交易还要满足利益冲突、动物福利、环境、数据处理和保密要求。优秀输出应把这些约束嵌入工作过程,而不是只在末页列一组免责声明。
噪声筛选也是评测的一部分
材料池刻意混入其他组合公司、差旅和文化活动等内部文件。它们测试 Agent 是否能解释排除理由,而不是因为文件来自内部就一律纳入交易结论。
交叉核对与补充证据
其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。
其他输入8 份证据
保留任务池中的配置或补充文件,避免 Agent 只挑选看起来最相关的材料。
在本任务中的用途用于形成投委会可挑战的事实、投资判断、风险和后续尽调问题。
补充材料:用于校准,而不是主导结论
这些配置、说明或跨主题材料用于补齐任务边界、核对口径和检查遗漏。它们应在需要时进入证据链,但不应取代更直接的市场、目标公司和一手访谈证据。
查看英文任务原文w1_t4
任务四:把复杂材料讲给高级交易发起人听
目标
制作一段短视频简报,并配套字幕,适合给高级交易发起人观看。该简报将综合初步评估中发现的最关键洞察和知识缺口。
要求
- 开场包含入门说明,覆盖鸡蛋生产供应链的端到端流程、母鸡生命周期和生产经济性,以及影响 Aurora 底线画像的副产品 / 收入抵销经济性。
- 总结关于 Aurora Eggs 和新西兰鸡蛋市场的初步发现。
- 识别确认性尽职调查期间必须回答的开放问题。
交付物
文件名: briefing.mp4 和 briefing.srt
这个任务检验 Agent 能否在最短时间内建立共同语言。它必须先讲清楚鸡蛋供应链、母鸡生命周期、生产经济和副产品,再讲 Aurora 与新西兰市场,最后落到必须验证的关键问题。
任务叙事阅读顺序:供应链与生命周期 → 生产成本和副产品 → 市场转型与 Aurora → 最大机会与最大风险 → 需要 senior sponsor 决策或继续追问的 DD 问题。
为什么这样交付输出是短视频和同步字幕。评分关注叙事是否清楚、字幕是否准确、是否把事实与假设区分开,以及是否把复杂研究压缩成可行动的沟通。
本任务如何阅读材料
行业、市场与监管21 份证据
回答行业有多大、渠道如何分配、cage-free 转型由什么驱动,以及 HPAI、零售集中度和消费者趋势如何改变供需与风险。
在本任务中的用途用于筛选短视频中必须讲清的背景、关键张力和行动结论。
行业底盘:谁在生产、用什么系统生产
先建立蛋鸡存栏、主要生产商和传统笼养、群养笼、平养、自由放养四类系统的共同语言。材料显示这是一个集中度不低、但公开口径并不完全一致的市场;Aurora 的相对位置必须通过多源交叉验证。
渠道权力:零售集中决定转型节奏
新西兰杂货零售高度集中,Foodstuffs 与 Woolworths 的采购政策会直接改变生产商的货架准入、包装蛋组合和资本开支时点。零售份额变化也解释了为什么不能把总消费量简单等同于 Aurora 的可服务市场。
两阶段转型:监管退出之后仍有商业期限
2022 年传统笼养退出是监管阶段;随后由主要零售商承诺推动的 2027 年非笼养货架转换,是第二个、更加商业化的期限。两者之间的错位造成了群养笼资产搁浅、短期供给收缩和价格溢价不确定性。
需求与价格:消费者愿望不等于支付意愿
健康观念、家庭预算、促销和替代蛋白共同影响鸡蛋需求。自由放养通常更受促销和价格弹性影响,平养与自由放养之间也存在明显替代,因此模型和投资判断都需要保留价格、销量与产品组合情景。
生物安全:一次疫情会穿透整个经营模型
HPAI 相关材料把扑杀、清洁、复养延迟、雏鸡补栏和额外生物安全成本串在一起。即使国家重新获得无疫状态,单场事件仍可能同时冲击供应、现金流、客户履约和转换计划。
交叉核对与补充证据
其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。
访谈与一手判断13 份证据
把协会、行业专家、退休顾问、农场主和 foodservice broker 的口述判断放在一起;它们常常包含公开资料看不到的份额、成本、转换时点和执行难点,但必须区分观点与已验证事实。
在本任务中的用途用于筛选短视频中必须讲清的背景、关键张力和行动结论。
先拼出市场与 Aurora 的隐形轮廓
行业专家首先补足公开资料缺失的生产商排序、份额、产品结构、客户集中度以及 Aurora 的收入和 EBITDA 轮廓。这些数字适合形成初始假设,但仍应标记为访谈判断并等待数据室验证。
再判断转型是否真的做得成
建设周期、资源许可、雏鸡供应、转换期间减产和价格溢价共同决定 colony-to-barn 计划能否按时完成。农场经营者的口述让工程计划从纸面资本开支变成可执行性问题。
沿价值链追问利润最后留在哪里
渠道访谈和价值链讨论用于拆解饲料、包装、零售自有品牌与 foodservice 中间环节的议价权,帮助区分行业收入增长与生产商实际利润改善。
把需求、成本和下行情景放进同一张图
后续访谈覆盖消费降级、替代品、竞争者、交易先例、投入成本、生物安全和资产替代用途。它们共同回答:基本情景失效时,Aurora 的盈利和资产价值还有多少缓冲。
交叉核对与补充证据
其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。
Aurora 与交易假设6 份证据
围绕目标公司的生产系统、客户、竞争位置、转换资本开支、副产品、替代用途和交易先例,帮助 Agent 把市场事实翻译成标的判断。
在本任务中的用途用于筛选短视频中必须讲清的背景、关键张力和行动结论。
卖方故事:Aurora 为什么现在寻求交易
目标公司材料描述其品牌、客户、生产网络、产品组合和部分出售以支持转型资本开支的逻辑。阅读重点不是复述卖方亮点,而是识别哪些主张尚未被外部证据或经营数据验证。
价值创造:保住渠道、完成转换、改善组合
交易假设依赖 Aurora 保住主要零售客户,按时完成群养笼向平养等系统的转换,并让更高福利产品的价格溢价覆盖新增折旧、运营和融资成本。每一环都应转化为可检验的里程碑。
下行保护:竞争、供应链与替代用途
竞争格局、供应商暴露、可比交易和资产替代用途材料用于测试估值边界:当价格溢价、转型时间或客户留存低于预期时,是否仍有可承受的 EBITDA、资产价值和退出路径。
内部组织与流程19 份证据
解释 Halberd 的角色分工、合规、ESG、信息安全、模板、投委会流程和干扰性资料,测试 Agent 能否在真实机构约束下工作。
在本任务中的用途用于筛选短视频中必须讲清的背景、关键张力和行动结论。
谁负责判断,谁负责挑战
组织图和项目流程明确 Sector Partner、交易团队、运营、ESG、合规和投委会之间的分工。Agent 的输出不是孤立研究报告,而是要能被不同角色复核、质询并继续推进。
证据如何进入正式决策
分析标准、投委会模板和品牌规范要求区分事实、推断与待验证事项,并保留来源、假设和计算链。格式不是装饰,它决定了结论能否被审计和复用。
真实机构约束:合规、ESG 与信息安全
跨境农业交易还要满足利益冲突、动物福利、环境、数据处理和保密要求。优秀输出应把这些约束嵌入工作过程,而不是只在末页列一组免责声明。
噪声筛选也是评测的一部分
材料池刻意混入其他组合公司、差旅和文化活动等内部文件。它们测试 Agent 是否能解释排除理由,而不是因为文件来自内部就一律纳入交易结论。
交叉核对与补充证据
其余材料用于核对口径、补足旁证或识别冲突;它们保留在阅读路径中,但不让文件清单取代叙事主线。
其他输入8 份证据
保留任务池中的配置或补充文件,避免 Agent 只挑选看起来最相关的材料。
在本任务中的用途用于筛选短视频中必须讲清的背景、关键张力和行动结论。
补充材料:用于校准,而不是主导结论
这些配置、说明或跨主题材料用于补齐任务边界、核对口径和检查遗漏。它们应在需要时进入证据链,但不应取代更直接的市场、目标公司和一手访谈证据。
查看英文任务原文
04 / 对照样本
同一任务,不同模型如何取舍
这些提交用于研究模型的工作方式,不计入排行榜。下面的评论依据仓库中实际交付物的结构与可见内容整理,不是官方评分;“页数、节点、公式、时长”只能帮助定位审阅重点,最终仍应逐项回到 rubric 和成品本身。
阅读方法先比较模型如何分配有限的页面或时间,再打开中文阅读版理解内容,最后查看原始成品验证视觉、公式、音画和可用性。
任务一:单页市场结构图比较的不是画面是否华丽,而是能否在一页中同时交代生产系统、竞争格局、价值链、渠道与转型逻辑。5 个模型样本
Claude 4 Opus Thinking
单页图 · 29 个 TikZ 节点
采用非常紧凑的单页图,节点数量在本组最少。
Claude Fable 5
单页图 · 214 个 TikZ 节点
生成了本组最复杂、节点最密集的 TikZ 结构。
Gemini 3.1 Pro
单页图 · 47 个 TikZ 节点
在简洁版与高密度版之间取中间路线。
GLM 5.2
单页图 · 77 个 TikZ 节点
以较多节点展开市场、价值链和交易背景。
GPT-5.5
单页图 · 81 个 TikZ 节点
节点数量较多,但源文件规模低于最密集样本。
注:o3 未提供任务一的对照提交。
任务二:可刷新市场模型重点观察工作表分工、公式链、输入来源、历史与预测衔接,以及转型和敏感性是否真的可以更新。6 个模型样本
Claude 4 Opus Thinking
7 张工作表 · 0 个公式单元
用七个工作表分别覆盖摘要、市场、产品组合、Aurora、转型、敏感性与假设。
Claude Fable 5
4 张工作表 · 680 个公式单元
四张表形成假设、历史、预测和转型的紧凑计算链。
Gemini 3.1 Pro
4 张工作表 · 0 个公式单元
采用四张核心工作表,结构直观。
GLM 5.2
10 张工作表 · 816 个公式单元
十张表覆盖封面、图例、市场、转型、敏感性、Aurora、利润池和开放问题。
GPT-5.5
4 张工作表 · 449 个公式单元
用四张表构建聚焦的假设、历史、预测和转型模型。
o3
6 张工作表 · 104 个公式单元
六张表覆盖输入、预测、转型、敏感性、Aurora 和说明。
任务三:目标公司评估 Deck页数只代表信息容量;真正要比较的是事实、判断、风险、价值创造与确认性尽调问题是否形成投委会叙事。6 个模型样本
Claude 4 Opus Thinking
11 页投委会材料
以 11 页完成相对精简的目标评估。
Claude Fable 5
19 页投委会材料
19 页,接近完整 IC pre-read 的展开方式。
Gemini 3.1 Pro
7 页投委会材料
七页,是本组最短的 Deck。
GLM 5.2
25 页投委会材料
25 页,是本组最长的目标评估。
GPT-5.5
17 页投委会材料
17 页,位于精简版与长篇版之间。
o3
9 页投委会材料
九页,采用较短的管理层式评估。
任务四:高级发起人视频简报时长和字幕密度能够提示取舍风格,但仍需回到视频检查音画同步、视觉变化,以及 primer、三项发现和三项开放问题是否齐全。6 个模型样本
Claude 4 Opus Thinking
35 秒 · 7 条字幕
视频约 35 秒、七条字幕,极度压缩。
Claude Fable 5
8 分 28 秒 · 49 条字幕
视频约 8 分 29 秒、49 条字幕,叙述最为展开。
Gemini 3.1 Pro
2 分 23 秒 · 24 条字幕
视频约 2 分 23 秒、24 条字幕,节奏较快。
GLM 5.2
9 分 48 秒 · 34 条字幕
视频约 9 分 48 秒、34 条字幕,是本组最长样本。
GPT-5.5
7 分 13 秒 · 37 条字幕
视频约 7 分 14 秒、37 条字幕,采用较完整的交易简报长度。
o3
1 分 30 秒 · 9 条字幕
视频约 90 秒、九条字幕,属于高度浓缩版本。