Thrive Holdings 与 OpenAI 如何通过融合从业者专业知识与 Codex 驱动的循环,为克里特岛会计师共同开发 Tax AI

真实系统在生产环境中的表现与实验室中不同,其故障方式在部署前难以预测。团队通常在上线后发现这些故障,然后花费数周检查边缘案例、调整提示词,并将生产反馈转化为持久的产品改进。这个反馈循环是手动且缓慢的,只有工程师推动时才能改进。但如今,借助精心设计的评估基础设施、直接接触从业者和真实环境的能力,以及 Codex 的前沿智能体能力,你可以构建能够自我改进的智能体。

在这篇文章中,我们将解析如何使用 Codex 构建这种类型的智能体。过去六个月,OpenAI 的前向部署工程师和研究人员与 Thrive Holdings 的工程师合作,为 Crete⁠(在新窗口中打开) 的 30 多家会计师事务所网络共同开发了 Tax AI,以帮助准备日益复杂的纳税申报表。Tax AI 不依赖工程师发现和修复每个故障,而是利用 Codex 将生产使用转化为结构化信号,从而驱动自主改进。

Crete 的从业者每个季节准备数万份纳税申报表,这需要处理数百万份底层文档。对于中高复杂度的申报,仅数据输入每份申报就可能需要八小时,通常涉及杂乱的数据源、往年文档以及手动提取和计算。他们向我们指出,在报税季最繁忙的时期,税务准备是一个重大瓶颈。

为了解决这个问题,Tax AI 在本报税季处理了参与试点的 Crete 公司的 7,000 份纳税申报表。该系统自动化了准备 1040 和 1041 纳税申报表中许多耗时的流程,但比效率提升更引人注目的是,该系统本身比三个月前首次部署的版本有了显著改进。

可衡量的自我改进

在 Tax AI 中,从业者上传源文件以及任何客户特定的备注。然后,Tax AI 创建一份税务引擎提交,供审核。它为从业者节省了大约三分之一的税务准备时间,起草的申报表准确率高达 97%,并将吞吐量提高了约 50%,从而为他们留出更多时间与客户相处。

我们可以通过了解 Tax AI 在不需后续更正的情况下完成申报的准确率来量化这种改进。我们通过检查达到 75%、90% 或 100% 正确字段完成率的申报比例来衡量准确性。上线时,只有四分之一的申报达到了 75% 的正确字段完成率,但六周内,86% 达到了这一标准。在 90% 和 100% 正确字段完成率水平上,系统显示出更快的增长。这些阈值让我们能够实际了解不同申报仍需多少从业者跟进。

早期,Tax AI 处理较简单的工作,如 W-2 和 1099 表格。随着季节推进,它进入了更复杂的申报,涉及 K-1、附表以及更难的边缘案例。每项新能力比前一项节省了更多每份申报的时间,因为它承担的任务更困难且手动操作更耗时。我们至今仍看到持续的进展。

接下来,我们将介绍我们的团队如何共同设计 Tax AI,使其通过依赖三个关键支柱实现自我改进:1)专家从业者反馈,2)生产轨迹(从输入到最终输出的结构化历史记录),以及 3)基于定制评估的 Codex 驱动迭代循环,以实现持续、更快的产品开发。我们希望我们的经验对其他构建者有用,尤其是在从业者专业知识对塑造整体系统质量和其中运行的数据至关重要的领域。

随着 Tax AI 扩展到更复杂的申报,达到 75%、90% 和完全完成率的评分申报比例在报税季持续上升。

问题

当我们进入税务准备的更困难部分(K-1、租赁房地产附表以及需要跨多个源文件对账数值的税务表格)时,很明显,真正的挑战在于产品是否能让复杂的生产故障变得可见、可理解且可操作。

在产品早期,大部分更正都是手动的。从业者可以纠正系统错误,但产品并未捕获完整的上下文:申报前更改的数值可能反映了真正的提取遗漏、映射问题、缺失的产品支持或预期的工作流噪声。分类这些情况仍需工程团队跟进。工程师可以使用编码智能体,但系统尚未设计为在改进循环中有意义地使用 AI。我们没有信号来确定要攀登的正确山峰。

我们的方法:三部分循环

这促使我们围绕三个支柱设计系统:

  1. 贴近从业者: 从事工作的人需要引导产品学习的内容。他们的直觉和理解揭示了哪些错误重要,并帮助确定工作流的哪些部分值得下一步关注。
  2. 构建产品,使生产产生证据: 产品必须捕获的不仅仅是输入和输出;它需要捕获从源材料、提取字段和出处到下游提交和专家更正的完整路径。
  3. 创建 Codex 驱动的改进循环: 一旦生产问题变得可见且结构化,它们就可以成为发现、定制评估和范围明确的工程任务。然后,Codex 可以帮助调查、提出更改、针对目标和回归评估进行验证,并比纯手动迭代周期更快地推动产品前进。

下面的租赁房地产示例展示了该循环在实践中如何运作,引导您了解从业者更正如何成为结构化发现,然后成为评估目标,最后成为 Codex 范围的工程任务。

租赁房地产示例

租赁房地产收入在个人纳税申报表的附表 E 中报告。从工程角度来看,提取它的任务描述起来简单,但做好却很难。系统必须读取杂乱的源材料(手写备注、电子邮件、电子表格和其他客户文件),提取系统可以自信地映射到税务引擎的租赁房地产字段,并保留足够的证据,以便从业者批准或更正结果。下面的简化示例展示了这些源文件和提取输出可能的样子。

租赁房地产源包被规范化为带引用的字段,然后映射到下游税务引擎概念。

1. 从业者更正揭示了一个故障

代理预测值与税务申报表中的实际值之间的差异,可能反映了真实的提取遗漏,但也可能是从业者的偏好、税务引擎中从上一纳税年度申报表结转的值,或者在申报工作流程中其他地方引入或更改的值。从业者帮助我们识别这些情况,以便我们确定哪些操作需要从业者纠正或阻止提交。

由于我们能够详细查看这些纠正,我们将审查过程从一个终端性的、失败后的步骤转变为一个持续的学习循环。我们设计了工作流程,将专家操作作为结构化数据捕获。现在,每一次干预都会通过记录 Tax AI 提出的内容、从业者修改的内容以及最终进入申报表的内容,来反馈到产品的改进循环中。

2. 产品痕迹将纠正转化为评估

对于像租赁房产这样复杂的工作流程,系统必须保留从源文件到最终申报表之间发生的一切。在这条路径上,文档被组织、拆分和分类;租赁房产字段被提取并附上源材料的引用;这些值被映射到税务引擎中;从业者可能在申报前仍然会纠正它们。这些产品级别的痕迹使得调查失败发生的位置成为可能。为了将从业者的纠正转化为有用的评估目标,系统通过三个步骤处理它们:

  • 捕获差异: 将 Tax AI 的输出与申报表进行比较,生成字段级别的审查行,捕获预期值、预测值以及差异是否看起来可操作。
  • 分组相关失败: 将相似的审查行分组,以将重复的产品失败与预期的工作流程噪音区分开来。例如,重复的从业者纠正可能表明 Tax AI 经常遗漏“公平租赁天数”字段、错误处理“其他费用”,或混淆同一源包中的多个租赁房产。
  • 将重复模式转化为评估目标: 一旦经过审查和衡量,重复的发现就会成为 Codex 改进的明确评估目标。

租赁房产审查行将重复的产品失败与预期的噪音分开,然后将可操作的案例转化为评估目标,为 Codex 提供一个可攀登的“山丘”。

3. 发现成为 Codex 可攀登的山丘

第三个支柱是创建一个能够根据这些新评估采取行动的工程循环。这正是 Codex 发挥核心作用的地方。

假设我们的评估管道标记出 Tax AI 始终遗漏“公平租赁天数”字段,而从业者则可靠地填写它。由于这个发现已经被打包成一个有针对性的评估集,包含代表性的源包和预期输出,Codex 可以直接在产品框架内调查根本原因。

Codex 不仅仅是在处理一个次优的最终输出。它同时检查痕迹、评估、代码库和技能:

  • 调查管道: 检查源包、提取模式、映射器行为和代码路径,以确定问题是未支持的字段、遗漏的提取模式、源选择问题、映射器缺口还是评分器问题。
  • 实施有针对性的修复: 扩展提取模式、改进租赁房产文档的源选择、更新税务引擎映射器,或者如果预期的工作流程噪音被计为失败,则优化评分器。
  • 验证并提出: 重新运行有针对性的评估,运行更广泛的回归测试套件,并提交一个候选拉取请求供工程审查。
  • 闭环: 将重复的从业者纠正转化为可衡量的工程任务。如果证据不明确或无法安全自动化,则该案例会路由回产品团队,而不是强制通过循环。

端到端的自我改进循环:生产痕迹揭示重复的字段级别纠正,这些纠正成为失败信号,Codex 可以结合痕迹、评估、代码库和技能进行检查。可操作的模式成为有边界的评估和候选产品变更;模糊的案例路由回工程师进行审查。每个已交付的改进都会为下一个循环创造新的生产证据。

如何使用 Codex 构建这个循环

租赁房产的例子代表了一种更广泛的可重用模式:利用生产工件和痕迹来改进代理的能力。给定来自生产数据的经过审查的发现、源痕迹、预期的税务引擎输出、相关代码示例和评估命令作为一组输入,Codex 可以在数周和数月内显著提高性能和准确性。这建立在我们关于驾驭工程Symphony的工作中描述的原则之上,这些工作详细介绍了如何使任务对 Codex 可读、提供范围化的上下文和工具,以及将验证和人工审查作为环境的一部分。

这些证据不会自动成为 Codex 的任务。从业者的纠正可能反映了提取遗漏、映射问题、不支持的产品行为、税务判断或预期的工作流程噪音。只有在重复的差异经过审查并分组为可操作的发现后,系统才会将它们转化为具有明确成功条件的有边界任务。

我们将这种自动化应用于产品的一个有边界层。这一层执行提取并将源文档映射到税务工作流程中。工程师仍然负责架构、产品决策和发布。从业者通过他们已经在做的工作来引导改进循环:纠正提取的值、审查申报表和批准最终申报。

对于 Codex 来说,结果不是一个模糊的警报,而是一个范围化的工程任务,包含证据、可编辑的产品表面和明确的验证门控。一个代表性租赁房产任务的上下文可以总结如下:

一个有边界的 Codex 任务环境将可写的工作树 [1] 与只读的生产上下文 [5] 分开。工作树包含 Codex 可以检查或修改的范围化产品表面 [2]、定义成功的有针对性的评估和回归评估 [3],以及编码了如何运行任务和尊重先前决策的可重用技能/文档 [4]。只读上下文提供生产痕迹、源文档、Tax AI 预测、最终申报表和税务引擎字段文档,以便 Codex 可以在不改变基础证据的情况下调查失败。

扩展到新领域

同样的循环也适用于租赁房产之外。租赁房产大约花了六周时间和大量的工程监督才达到 90% 的精确率和召回率,但这项工作产生了可重用的抽象、审查工件、评估约定和实现模式,使得支持类似复杂度的附表(如附表 C 和附表 A)变得更加容易。

税务AI证明了构建自我改进型智能体的可行路径。从业者通过提供服务生成高价值反馈信号,产品工作流将这些信号保留为结构化证据。基于评估的工程系统在改进措施进入生产环境前进行验证,而智能体驱动的循环机制则使系统持续处于自我优化的流动状态。

Thrive Holdings的组织架构使我们能够在特定行业复制这种环境。作为兼具所有者与运营者双重身份的控股公司,我们的联合工程团队能够直接与从业者及来自内部企业(如Crete)的生产数据协作——不是以供应商身份,而是作为合作伙伴。这意味着技术、产品与服务同属一个体系,帮助我们更快推进并打造卓越产品。

一位去年花费180小时处理税务申报的高级会计师,今年仅用了15小时。她将节省的部分时间用于逐一联系客户并指导他们完成申报——这种高触达服务在一年前还无法实现。其余时间则用于拓展新客户和开发新服务项目。

如今,我们的团队正将税务AI的三部分设计蓝图应用于Thrive Holdings旗下其他领域的工作流构建:包括簿记与审计等会计工作流,以及IT服务台自动化等运营工作流。跨领域、跨行业的自我改进型智能体正展现出更广阔的前景。最优秀的智能体始终由人类引导学习,随着时间推移变得更具能力、更值得信赖、也更有价值。

欲了解更多参与此项目的OpenAI团队信息,请联系我们

本文内容采集自官方网站,排版和翻译可能与原页面存在差异。

阅读官方全文