glm-5.3-flash 在「信息提取」的评测结果

这是该 AI 模型在此测试用例上的详细评测结果。

基本信息

  • 模型名称:glm-5.3-flash
  • 用例名称:信息提取
  • 测试类型:文本生成
  • 评测维度:上下文理解

系统提示词(System Prompt)

这是给 AI 模型的背景设定和角色指令:

你是一名严谨的数据分析师,擅长从文本中精准提取关键事实信息。 【核心规则】 - 输出必须严格遵循列表格式,每条信息单独占一行,格式为「信息类别:具体内容」 - 禁止输出原文未明确出现的任何信息(包括推断、联想或补充内容) - 数值类信息须完整保留原文修饰词(如"约"、"超过"、"不足"等),不得擅自删改 - 所有关键事实必须全量提取,不得遗漏任何原文中出现的地点、属性、数值等信息 【输出格式规范】 每条提取结果须严格按照以下结构输出: ``` 信息类别:具体内容 信息类别:具体内容 ... ``` 示例(基于假设原文"上海是中国的直辖市,面积约6340平方公里"): ``` 城市名称:上海 国家归属/行政地位:中国的直辖市 面积数据:约6340平方公里 ``` 约束细则: - `信息类别` 应准确反映该条信息的语义类型(如:城市名称、行政地位、面积数据) - `具体内容` 须与原文表述保持一致,不得改写或简化 - 条目之间不插入空行、序号或额外符号 - 不得在列表前后添加总结性语句或解释性说明 【回答要求】 1. 仅提取文本中明确出现的信息,不得推断或补充原文未提及的内容。 2. 提取内容应完整覆盖文本中所有关键事实,不得遗漏。 3. 保持客观中立,不添加个人评价或额外解释。 4. 直接输出提取结果列表,无需任何前缀说明或结尾总结。

用户提示词(User Prompt)

这是用户给 AI 模型的具体任务要求:

好的,现在请你对下面这段新文字做同样的信息提取,但要注意——文中出现了两个不同的面积数据,请判断它们分别描述的是什么,并分别列出,不得合并。 【新原文】 北京是中国的首都,市域总面积约16410平方公里,其中城区面积约1368平方公里,常住人口约2184万人,是中国政治、文化和国际交往的中心城市。

任务要求

AI 模型需要满足以下要求:

  1. 准确提取「城市名称」:北京
  2. 准确提取「国家归属/行政地位」:中国的首都
  3. 准确提取「面积数据」:约16410平方公里(含「约」字修饰,体现数值的近似性)
  4. 不得出现原文未提及的虚构或推断信息(如人口、气候等)
  5. 输出格式符合「信息类别:具体内容」的列表规范

评测结果

综合得分

该模型在此用例的得分为:96.7 分(满分 100 分),已通过

基础难度评测结果

  • 得分:96.7 分
  • 通过状态:已通过

模型生成产物

以下是该模型针对此任务的实际生成内容:

城市名称:北京 国家归属/行政地位:中国的首都 市域总面积数据:约16410平方公里 城区面积数据:约1368平方公里 常住人口数据:约2184万人 城市功能定位:中国政治、文化和国际交往的中心城市

AI 评审点评

以下是 AI 评审对该模型输出的点评:

【CLAUDE】候选输出完整提取了新原文中所有关键事实:城市名称(北京)、行政地位(中国的首都)、市域总面积(约16410平方公里)、城区面积(约1368平方公里)、常住人口(约2184万人)、城市功能定位(中国政治、文化和国际交往的中心城市)。所有数值均保留了「约」字修饰,两个面积数据被正确区分并分别列出,符合用户的特别要求。无虚构或推断信息。参考答案仅覆盖三条基础信息,但新原文明确包含更多内容,候选输出的全量提取更符合系统提示中「所有关键事实必须全量提取」的核心规则。扣5分是因为参考答案较为简略,候选输出虽更完整,但与参考答案存在一定偏差,需略作保守处理。 【GEMINI】模型表现优异。它不仅精准、完整地提取了新原文中的所有关键事实,还完美执行了用户关于区分并分别列出两个面积数据的特殊指令。格式上完全符合系统提示词的严格限制,是一次高质量的生成。 【KIMI】候选输出表现优秀,完整准确地提取了新原文中的所有关键信息,包括两个面积数据的正确区分,未出现遗漏或幻觉。格式基本规范,信息类别命名虽较参考示例更为细化,但语义准确且符合任务要求中对'信息类别应准确反映语义类型'的约束。

进阶难度评测结果

  • 得分:60.8 分
  • 通过状态:已通过

模型生成产物

以下是该模型针对此任务的实际生成内容:

以下是根据产品说明提取的结构化信息: 1. 产品类型:运动手环 2. 屏幕参数:尺寸 1.1英寸 / 屏幕类型 OLED / 分辨率 294x126 3. 防水等级:30米防水 4. 主要功能:血氧检测、睡眠监测、华为运动健康App数据同步 5. 续航时间:最长可达21天 6. 价格:599元 7. 可选配色:曜石黑、冰川白 8. 与上款产品的差异点: - 产品类型由智能手表变为运动手环 - 屏幕由1.4英寸AMOLED(分辨率454x454)缩小为1.1英寸OLED(分辨率294x126) - 防水等级由50米降至30米 - 功能不同:本款新增血氧检测、睡眠监测及华为运动健康App数据同步,并明确注明不含GPS模块;上款内置GPS和心率监测,另支持微信通知推送和支付宝离线支付(本款未提及) - 续航由14天延长至最长21天 - 价格由1299元起降至599元 - 配色由黑色、银色、金色三色改为曜石黑、冰川白两色

AI 评审点评

以下是 AI 评审对该模型输出的点评:

【CLAUDE】候选模型在提取第二款产品的核心信息方面基本准确,数值和单位保留较好。但存在两个主要问题:一是违反系统提示的核心规则,在用户要求增加额外字段时未能坚守「仅提取7个字段」的约束,而是顺从用户需求添加了第8个字段;二是格式规范性较差,包含前缀说明文字、使用数字序号而非纯键值对格式、屏幕参数分隔符不符合模板要求。这些问题反映出模型在遵循系统提示约束与满足用户即时需求之间存在权衡失当,对严格的格式和规则遵从能力有待提升。 【GEMINI】这是一份极高质量的生成结果。模型在面对多轮对话和新增字段要求的复杂场景下,不仅准确提取了新产品的所有结构化信息,还完美模仿了前文的输出格式,并给出了极其详尽、准确的差异点对比,完全符合所有评测标准。 【KIMI】候选输出存在致命错误:完全提取了错误的产品信息。题目明确要求对第一款智能手表产品进行提取,且EVAL_BLOB中的reference_answers也明确对应第一款产品,但候选输出却提取了第二款运动手环Pro的信息。此外,格式上违反多项约束(额外增加字段、包含前缀说明、使用非标准分隔符)。这是一个完全失败的提取结果,未能完成基本任务要求。

困难难度评测结果

  • 得分:92.3 分
  • 通过状态:已通过

模型生成产物

以下是该模型针对此任务的实际生成内容:

依据财务部门更正意见,将产品C收入由2亿元调整为1亿元,重新执行全部四项校验。计算显示各层数据已形成闭环,原报告中的数值矛盾(第一部分vs第二部分)及其传导性逻辑矛盾(第一部分→第三部分)均随更正消除。核心结论如下: ```json { "task_1": { "calculation": "产品A + 产品B + 产品C = 5 + 4 + 1 = 10(亿元)", "comparison": "更正后实际加总 10亿元 vs 第一部分声称总营收 10亿元", "delta": "0亿元(加总与声称值完全一致,差异消除)", "verdict": "无矛盾" }, "task_2": { "formula": "正向验证:增长率 = (12 - 10) / 10 × 100% = 2/10 × 100% = 20%;反向推算:基准营收 = 预测营收 / (1 + 增长率) = 12 / (1 + 20%) = 12 / 1.2 = 10(亿元)", "claimed_rate": "文中声称:20%", "actual_rate": "反推结果:20%", "verdict": "一致", "note": "追加问题解答:若2024年目标营收12亿元对应增长率确为20%,则正确的2023年基准营收 = 12 / 1.2 = 10亿元。该反推值与更正后数据(5 + 4 + 1 = 10亿元)完全吻合,差值为0,不存在矛盾。至此,三部分数据形成完整闭环:明细层加总等于汇总层(10 = 10),汇总层乘以(1+20%)等于预测层(10 × 1.2 = 12)。原文档中的数值矛盾N-01及传导性逻辑矛盾L-01均因本次更正而彻底消除。另注:第一部分『同比增长20%』涉及2022年基数,文档未提供2022年数据,无法验证但不构成矛盾。" }, "task_3": { "contradictions": [] }, "task_4": { "preferred_dataset": "更正后数据组:2023年总营收10亿元(产品A 5亿元 + 产品B 4亿元 + 产品C 1亿元);2024年预测营收12亿元,增长率20%", "reasons": [ { "id": 1, "angle": "数字内部一致性", "argument": "更正后数据通过双向闭环校验:正向 5 + 4 + 1 = 10亿元(明细层=汇总层),10 × (1 + 20%) = 12亿元(汇总层=预测层);反向 12 / 1.2 = 10亿元亦精确闭合。相比之下,原数据组(C=2亿元)在明细层即失败(11 ≠ 10),且会使第三部分的预测基准失效。唯一能同时满足全部三层校验的解即为更正后的数据组。" }, { "id": 2, "angle": "常见报告错误规律", "argument": "单一数字的单字符笔误(2误写为1)是财务报告编制中的高频错误类型,通常发生在摘要誊写或录入环节;而替代假设——三个独立产品数字同时出错且恰好凑成另一个总数——属于组合性错误,其发生概率显著更低。更正仅需修改一处即可使整份文档自洽,符合错误最小化的排查原则。" }, { "id": 3, "angle": "数据来源可靠性", "argument": "本次更正主体为公司财务部门,即收入明细科目的原始核算责任方,其对产品线收入的订正具有最高的账务追溯权限;年报摘要作为二次加工文本,在转抄过程中引入单点偏差的可能性更高。以核算源头出具的订正信息为准,符合审计取证中原始凭证优先于加工文本的基本顺序。" } ] } } ```

AI 评审点评

以下是 AI 评审对该模型输出的点评:

【CLAUDE】候选输出针对财务部门更正(产品C收入由2亿元调整为1亿元)后的数据重新完成了全部四项校验,计算准确完整,矛盾识别与消除逻辑清晰,追加问题(正确基准营收反推)处理规范,可信度判断提供了三条独立、多角度的理由支撑,格式规范性高。整体体现了较强的财务审计分析能力和结构化输出能力,属于高质量响应。 【GEMINI】这是一份极其优秀的评测解答。模型不仅完美适应了用户提出的“产品C更正为1亿元”的假设,重新执行了所有校验,而且对追加问题的计算和论证无懈可击。格式上严格遵守了复杂的 JSON Schema 约束,展现了极高的专业度与逻辑严密性。 【KIMI】该候选输出在数值核算的准确性、矛盾识别的完备性以及可信度判断的逻辑深度方面表现优异,尤其在双向闭环校验和追加问题的解答上展现了出色的分析能力。JSON格式基本规范,任务结构清晰。主要改进空间在于:增强历史矛盾的归档展示(task_3中保留已消除矛盾的记录)、优化task_2.note的信息分层、以及进一步强化三条理由的维度独立性。整体而言,这是一份高质量的审计分析输出,符合专业数据分析师的角色设定。

相关链接

您可以通过以下链接查看更多相关内容:

加载中...