ppt
答辩人:张智勇 部门:数据AI部 岗位:AI 应用工程师
导师:郑灿升 答辩日期:2026 年 8 月 6 日
建议总时长:约 20 分钟,其中功能演示约 3 分钟
这不是需要逐字背下来的稿子。每一页只要记住“记忆锚点”,再结合页面上的图往下讲。
方括号里的内容是动作提示,不需要说出来。加粗的“翻页句”可以用来衔接下一页。
整场只记住一条主线
人工资料审核很重 → 我们让 AI 做前置预审 → 先解决“意见能不能对齐人工” → 再解决“怎么兼顾效果、成本和速度” → 用产品和测试证明方案可行 → 最后说明价值、扩展性与不足。
第 1 页|封面(约 30 秒)
记忆锚点:让 AI 先看资料,让审核员回到现场。
各位领导、同事,还有 HR,大家好,我是数据AI部的张智勇。
我今天汇报的项目是“供应商导入稽核 AI 审核平台”。这个项目想解决的问题很直接:供应商稽核开始之前,审核员要花很多时间查看资料。我们希望让 AI 先完成这部分前置工作,把材料中的问题和现场重点提前找出来。
所以这套系统不是要替代审核员。它的定位是让 AI 先看资料,再让审核员把时间用在更需要经验的现场判断上。
翻页句:下面我先从业务背景讲起,说明为什么需要做这件事。
第 2 页|第一章转场(约 10 秒)
第一部分主要讲三个问题:现在的审核工作量有多大,人工审核具体痛在哪里,以及业务最终需要一套什么样的系统。
第 3 页|业务背景:人工审核现状(约 1 分 20 秒)
记忆锚点:150 家、250 条、375 人天。
[先指向左侧三个数字]
这个项目服务的业务方是商显 BG。商显 BG 每年预计要完成大约 150 家供应商的导入和年度稽核。
一家供应商如果做完整 QPA,大约有 250 条。按一家 2.5 人天计算,一年的总投入大约是 375 人天。
[再指向右侧流程图,从左往右讲]
目前的资料主要通过邮件或者线下 Excel 流转。供应商把制度文件、执行记录、表格和图片直接放在自评 Excel 里。审核员收到之后,要先收集文件,再逐个打开附件,然后对照条款判断,手工记录问题,最后把这些问题带到现场继续确认。
这里的 2.5 人天,大致包括 0.5 人天的资料审核、1 人天的现场文件审核,以及 1 人天的生产现场审核。可以看到,这个流程几乎每一步都依赖人工。
翻页句:工作量只是表面问题,真正影响审核效率和质量的,是下面四个痛点。
第 4 页|核心痛点(约 1 分 20 秒)
记忆锚点:材料杂、关联乱、标准不稳、现场被挤压。
这一页的四张图,就是我们在真实审核过程中看到的典型情况。
[指第一张图]
第一个问题是条款多,材料也很杂。完整 QPA 大约 250 条,一条下面还可能有多个附件。审核员需要在文档、表格、图片和扫描件之间来回切换。
[指第二张图]
第二个问题是证据和条款的关系不稳定。文件虽然存在,却不一定能证明当前这条要求。还可能出现附件放错位置、内容过期、同一份材料重复使用,或者只有制度声明却没有执行记录。
[指第三张图]
第三个问题是评分边界会因人而异。不同审核员面对同一份材料,可能对“符合、部分符合、不符合”有不同理解。很多判断依赖个人经验,还没有沉淀成统一规则。
[指第四张图]
第四个问题是资料审核挤压了现场时间。审核员把大量时间用在找材料和核对文件上,到了现场之后,反而没有足够精力关注制程、设备、人员和真实执行情况。
翻页句:把这四个痛点合在一起,我们得到了一条非常明确的业务需求。
第 5 页|业务需求(约 1 分钟)
记忆锚点:一个输入,一次预审,一份报告。
这一页可以用一句话概括:供应商只上传一份自评 Excel,系统直接生成一份可以用于现场稽核的审核报告。
这里有一个容易误解的地方。供应商不需要把每个附件单独上传。制度文件、执行记录和图片,本来就嵌在自评表里,所以系统的输入只有这一份 Excel。
系统需要解析表格和里面的附件,然后围绕大约 250 条 QPA 条款完成审核。最终输出不仅有条款结论,还要说明判断依据、存在的问题,以及需要带到现场继续确认的关键稽核项。
我们真正想实现的,是让资料风险在进场前就被看见。这样审核员到现场以后,不用再从头翻材料,而是可以直接验证重点问题。
翻页句:需求明确以后,第二章重点讲我们怎样设计方案,以及落地时遇到的两个代表性难题。
第 6 页|第二章转场(约 10 秒)
第二部分先看引入 AI 前后的流程变化。然后我会重点讲两个难题:第一,AI 的意见怎样对齐人工;第二,怎样同时保证效果、成本和速度。
第 7 页|审核流程对比(约 1 分钟)
记忆锚点:传统流程五步都靠人,新流程前四步交给 AI。
[先看左侧 BEFORE]
传统流程里,从收材料、开附件、对条款,到记录问题和进入现场,五个环节都需要审核员亲自完成。人的时间大量消耗在重复查找和整理上。
[再看右侧 AFTER]
引入 AI 之后,供应商仍然只需要上传 Excel。后面的解析、资料预审和报告生成都由系统完成。审核员主要保留最后一个环节,也就是确认关键风险,并在现场判断真实执行情况。
所以我们的目标不是把人从流程里拿掉,而是改变人的工作重心。AI 处理适合机器完成的重复工作,人负责需要经验、沟通和现场观察的部分。
翻页句:确定这条流程之后,我们没有马上去选模型,而是先研究审核员到底是怎样得出结论的。
第 8 页|方案怎样确定(约 1 分钟)
记忆锚点:先还原人的判断,再设计 AI 的流程。
这一页说明我们是怎么确定方案的。
一开始我们没有先问“应该用哪个大模型”。我们先去还原审核员的真实工作过程。
审核员拿到一条 QPA,第一步是理解这条要求到底想检查什么。第二步是找到对应的制度、记录或者图片。第三步是判断这些材料是否有效,能不能证明实际执行。最后才是形成结论,并决定哪些问题要带到现场确认。
因此,系统也必须把条款、证据和判定规则连起来。只识别出一段文字,或者只看见有一个附件,都不能算完成审核。
方案确定以后,我们发现真正困难的并不是“AI 能不能读材料”,而是两个更关键的问题。
翻页句:第一个,也是我投入最多测试和优化工作的难题,就是 AI 和人工的一致性。
第 9 页|难点一:审核意见一致性(约 1 分 10 秒)
记忆锚点:如果还要人工逐条重审,AI 就没有真正创造价值。
这一页中间是同一条款和同一份材料。左边是 AI 的分析,右边是审核员的分析。
系统能识别材料,只能说明 AI 可以开始工作。真正决定它能不能落地的是:面对同样的信息,AI 能不能关注到和审核员相同的问题,使用接近的判断逻辑,最后给出尽可能一致的意见。
如果 AI 审完以后,审核员还是要把 250 条全部重新看一遍,那就不是节省工作,而是在原有流程上又增加了一道工序。
所以我们把人工审核意见作为基线。每次测试都比较 AI 和人工在哪些条款上不一致,再分析差异到底来自证据理解、规则边界,还是模型判断。目标不是让 AI 学会一套审核话术,而是让它的分析过程和最终意见尽量对齐人工。
翻页句:为了让这种对齐能够持续优化,我们提出了 Profile。
第 10 页|Profile:按条款匹配规则(约 1 分 30 秒)
记忆锚点:不是一个大提示词,而是每条条款都有自己的审核说明书。
这里先回答一个很自然的问题:为什么不把 250 条规则全部写进一个大提示词,然后一次性交给 AI?
[指左侧]
因为不同条款看的东西完全不同。有的看体系文件,有的看检验记录,有的看人员培训,还有的看现场照片。如果全部混在一起,AI 需要自己从几百条规则中寻找当前条款该看什么。其他条款的要求也可能干扰当前判断。
更麻烦的是,一旦 AI 和人工出现差异,我们很难知道到底是哪一段规则造成了问题,也很难只修改一条而不影响其他条款。
[指右侧]
所以我们提出 Profile。可以把它理解成给每一条 QPA 配一张审核说明书。
这张说明书是分层组织的。最上面是所有条款都遵守的全局规则。再往下是当前物料线的业务语境,以及不同审核标准的差异。最后才是当前条款自己的关注点和判定边界。
系统审核某一条时,只加载共同规则和这条真正命中的规则,不会把其余 249 条一起塞进去。
这样做以后,每次发现 AI 和人工不一致,我们都能定位到具体条款,单独调整 Profile,再通过标准测试验证。审核经验也就从个人脑中的判断,变成了可复用、可测试、可追溯的版本。
翻页句:一致性问题有了解法以后,我们还遇到第二个难题。250 条背后的材料难度并不一样。
第 11 页|难点二:效果、成本与耗时(约 1 分钟)
记忆锚点:全部用强模型太慢,全部用轻模型又不够准。
同一份自评 Excel 里,材料的形式差别很大。有些条款只要核对一段明确文字,有些要看执行表格,还有一些必须理解扫描件或者现场照片。
如果 250 条全部使用高能力视觉模型,复杂图片可能看得更细,但普通文字也要承担同样的调用成本和等待时间。整批审核会很慢。
反过来,如果全部使用轻量文本模型,速度会快很多,但它面对复杂扫描件和现场照片时,可能看不到真正的证据,结果就不稳定。
因此,我们需要同时满足三件事:复杂证据不能漏判,高能力模型不能被滥用,整批审核还要跑得足够快。
所以问题不是简单地选一个模型,而是判断每条材料应该走哪一条路径。
翻页句:我们的解法,就是把不同风险、不同形式的材料分层处理。
第 12 页|分层审核与并发(约 1 分 20 秒)
记忆锚点:规则优先,文本为主,视觉兜底,并行执行。
[沿着流程图从左往右讲,不需要把每个框里的字全部念完]
系统拿到自评 Excel 并完成解析以后,会把条款放入并发任务池。每条条款先判断证据是否明显缺失。
如果没有附件,或者属于非常明确的缺失情况,就走快速路径。这个时候不需要调用高成本模型。
如果有材料,系统优先进行 OCR 和文本审核。制度文件、执行记录这类内容,大部分在文本路径上就可以完成判断。
只有文本不足以支撑结论,并且确实存在复杂图片或者疑难扫描件时,才升级到视觉模型复核。最后,各条路径的结果都会回到统一结构,生成审核报告。
在执行层面,我们还给不同环节设置独立并发。当前稳定配置是条款 48、OCR 10、文本审核 40、视觉审核 6。这里不是并发越高越好,而是要避免某一个环节堵住整批任务。
这套方案的核心就是:把高能力模型用在真正需要理解的材料上,在保证可靠性的前提下控制成本和总耗时。
翻页句:前面讲的是方案,下面我用实际功能演示说明它在系统里怎样工作。
第 13 页|第三章转场(约 10 秒)
第三部分有三组演示。第一组看上传和审核报告,第二组看 Profile 怎样配置,第三组看标准测试怎样推动规则持续优化。
第 14 页|上传与审核报告(约 1 分 30 秒,含视频)
记忆锚点:一份 Excel 进去,一份可行动报告出来。
[播放左侧“上传”视频]
左边是输入过程。供应商只需要上传一份自评 Excel。制度文件、执行记录、图片和嵌入附件都已经在表格里,不需要再一个个上传。
系统收到文件以后,会解析条款和表内佐证,并把它们整理成可以逐条审核的任务。
[播放右侧“审核报告”视频]
右边是最终输出。报告不只是给一个总分。它会保留每条条款的结论、判断依据和审核意见,也会汇总风险,并提炼需要到现场继续确认的关键项。
这就把原来的“人工翻完整份材料”,变成“AI 先形成结构化结果,审核员再围绕关键风险行动”。
翻页句:报告能不能稳定,取决于背后的审核规则能不能被清楚地配置和维护。
第 15 页|Profile 设计演示(约 1 分 10 秒,含视频)
记忆锚点:把审核员的判断标准,配置到具体条款上。
[播放视频,画面切到对应位置时再讲]
这里展示的是 Profile 的实际配置过程。
针对一条具体 QPA,我们会先写清楚它真正关注什么。然后定义证据边界,也就是什么材料可以算充分证据,只有制度声明时应该怎样判断。最后再明确结论边界,以及需要带到现场核验的问题。
Profile 不是简单堆提示词。它的作用是把审核员原本依赖经验完成的判断,整理成条款级规则。
这些规则可以保存成版本,也可以复制后继续修改。这样既能保护历史审核的可追溯性,又能通过后续测试不断优化。
翻页句:规则写出来并不代表一定有效,所以还需要一套标准测试来验证。
第 16 页|标准测试流程(约 1 分 20 秒,含视频)
记忆锚点:不是只看分数,而是用差异项反推规则。
[播放标准测试视频]
标准测试的起点是一份人工基线,也就是审核员已经确认过的答案。系统使用当前 Profile 重新审核同一份材料,然后逐条比较 AI 和人工结果。
我们重点看的不是一个孤立的总分,而是具体哪些条款不一致。发现差异以后,会继续判断原因:是材料关联错了,是规则写得不清楚,还是模型对证据的理解出现偏差。
定位原因以后,我们只修改对应的 Profile,再跑一轮完整测试,确认新问题被修复,同时检查原来正确的条款有没有回退。
目前 OpenCell 基准集的一致率达到 97.2%。这个结果不是一次得到的,而是通过“发现差异、修正 Profile、重新验证”的循环逐步提升的。
标准测试真正沉淀下来的,不只是一个分数,而是一套可以持续改进的审核经验。
翻页句:功能和验证讲完以后,最后一部分回到业务,看看项目能带来什么价值,又有哪些边界。
第 17 页|第四章转场(约 10 秒)
最后一部分,我会从三个方面做总结:业务价值、方案的可扩展性,以及项目目前还存在的不足。
第 18 页|业务价值(约 1 分 10 秒)
记忆锚点:225 人天是理论空间,97.2% 是当前测试结果。
项目的价值不只是让审核速度更快,更重要的是让审核员把时间用在更有价值的现场判断上。
按当前业务测算,如果单家稽核能够从 2.5 人天压缩到 1 人天,每年按照 150 家供应商计算,理论上可以节省大约 225 人天。
流程上,资料预审被提前完成。审核员进入现场以后,可以重点确认制程、设备、人员和执行真实性,不需要继续从头翻文件。
质量上,我们用 Profile 和标准测试沉淀统一判断。目前 OpenCell 基准集的一致率是 97.2%,说明 AI 的审核意见在当前数据上已经能够较好地接近人工。
这里我也想强调口径:225 人天是理论测算,97.2% 是当前基准集结果。实际能节省多少时间,还需要在正式试点中用真实数据验证。
翻页句:除了当前业务价值,这套方案从设计开始就考虑了后续复制。
第 19 页|方案可扩展性(约 1 分钟)
记忆锚点:核心能力复用,业务规则适配。
我们想复制的不是某一份固定提示词,而是一套完整闭环。
最中间的 AI 审核引擎,包括 Excel 解析、任务路由、标准测试和报告输出。这些属于通用能力,可以继续复用。
如果扩展到同一物料线的其他供应商,主要校准材料命名和少量特殊证据。
如果扩展到其他物料线,系统框架仍然可以复用,但要重新适配新的 QPA 条款、证据要求和评分边界。
再向其他 BG 或集团复制时,还需要结合新的权限流程、系统集成方式和报告模板。
所以场景扩得越远,需要调整的业务规则越多,但不需要从头开发整套系统。这也是 Profile 和规则版本化设计的意义。
翻页句:扩展性是目标,但我们也需要客观看待当前结果,项目还有三个问题没有完全验证。
第 20 页|不足与后续优化(约 1 分 20 秒)
记忆锚点:一份数据、人工调规则、理论价值。
第一个不足是数据泛化。目前 97.2% 主要来自一份 OpenCell 供应商数据。因为 Profile 也是围绕这份数据持续优化的,所以存在过拟合风险。下一步要补充同一物料线下更多供应商,并把调优数据和盲测数据分开。每个新版本都要回归全部数据。
第二个不足是规则治理。现在发现不一致项以后,仍然需要人工分析原因,再修改对应 Profile。以后数据和物料线变多,维护成本会继续上升。后续可以增加差异原因分类、版本对比和跨数据集自动回归,并设置推荐版本的准入门槛。
第三个不足是业务价值还没有经过规模化验证。225 人天是理论空间,一致率高也不等于一定能节省同样多的时间。后续要通过真实供应商试点,记录 AI 审核耗时、人工复核时长、改判率,以及现场问题的命中情况。
所以下一阶段不是继续追求这一份数据上的更高分数,而是要证明三件事:换一家供应商仍然有效,规则能够持续维护,业务收益可以真实兑现。
翻页句:最后,我用一页总结项目,也总结这段实习对我的提升。
第 21 页|总结与个人成长(约 50 秒)
记忆锚点:AI 做前置辅助,人做关键判断。
回顾整个项目,我们把原来高度依赖人工逐份翻阅的资料审核,逐步变成了一套能够按条款执行、可以通过标准测试验证、也能够持续优化的流程。
在这个项目里,我主要负责把业务问题转成需求,并围绕测试结果持续优化方案。具体包括需求梳理、测试验收、Profile 调整、不一致项分析和产品体验改进。我推动的重点,是让业务标准、AI 审核逻辑和最终验证结果尽量对齐。
这段实习让我最大的收获,是学会了怎样把一个比较模糊的业务问题拆成可实现的系统方案,再用数据验证它是否真的有效。我也更深地体会到,AI 应用落地不只是接入模型。它还需要理解业务、设计规则、验证结果,并和业务、研发、测试持续协同。
我的汇报到这里,谢谢大家,欢迎各位老师提问。
上场前的 1 分钟复习卡
只记下面十句话,忘词时看 PPT 上的图继续说:
- 项目定位:让 AI 先看资料,让审核员回到现场。
- 业务规模:每年约 150 家,每家约 250 条,年度约 375 人天。
- 四个痛点:材料杂、关联乱、标准不稳、现场时间被挤压。
- 业务需求:一份自评 Excel,生成一份可行动的审核报告。
- 流程升级:传统五步都靠人,新流程前四步交给 AI。
- 难点一:AI 的分析和意见必须尽可能对齐人工,否则还要逐条重审。
- Profile:不是一个大提示词,而是给每条条款匹配自己的审核说明书。
- 难点二:强模型全部使用太慢,轻模型全部使用又容易漏判。
- 分层方案:规则优先、文本为主、视觉兜底,并行执行。
- 结论:当前一致率 97.2%,理论节省空间约 225 人天,但还要继续验证泛化和真实收益。
忘词时的通用救场句
- “这一页最想说明的是……”
- “大家可以先看左边的传统流程,再看右边引入 AI 后的变化。”
- “这里不用关注具体技术名词,核心逻辑是……”
- “这个结果说明方向可行,但我也需要强调它目前的验证边界。”
- “前面解决的是效果问题,接下来解决的是效率问题。”
