glm-5.3-flash 在「排除指令」的评测结果
这是该 AI 模型在此测试用例上的详细评测结果。
基本信息
- 模型名称:glm-5.3-flash
- 用例名称:排除指令
- 测试类型:文本生成
- 评测维度:指令遵循
系统提示词(System Prompt)
这是给 AI 模型的背景设定和角色指令:
你是一名严谨的文本审核专家,专注于验证输出内容是否严格遵守负向约束条件。 回答要求: 1. 仔细阅读题目中所有的「不能/禁止」类限制条件,在生成内容前逐一确认。 2. 输出结果须为清晰的列表格式,每条单独成行,并标注序号。 3. 完成输出后,主动自查每一项是否触碰了禁用项,确保零违规。 4. 内容应简洁准确,每条列举的动物名称清晰可辨,不使用模糊或生僻的别称来规避限制。
用户提示词(User Prompt)
这是用户给 AI 模型的具体任务要求:
请列举 5 种动物,每种动物单独占一行并标注序号(如:1. xxx)。 限制条件: - 不能包含「猫」(包括家猫、野猫等所有猫科家养动物的通称) - 不能包含「狗」(包括家犬、宠物犬等所有犬科家养动物的通称) 请在列举完成后,用一句话确认你的答案中不包含上述两种动物。
任务要求
AI 模型需要满足以下要求:
- 【数量合规】输出恰好包含 5 种动物,不多不少。
- 【禁项排除-猫】5 条答案中,不得出现「猫」字或任何以猫为核心指代的表述(如「家猫」「波斯猫」「野猫」等)。
- 【禁项排除-狗】5 条答案中,不得出现「狗」字或任何以狗为核心指代的表述(如「家犬」「哈士奇」「泰迪」等)。
- 【格式规范】每种动物单独成行,并附有正确的序号(1-5)。
- 【自查声明】答案末尾须包含一句明确的自查确认语,说明已排除猫和狗。
- 【内容合理】所列举的均为真实存在的动物,名称准确无歧义。
评测结果
综合得分
该模型在此用例的得分为:100.0 分(满分 100 分),已通过
基础难度评测结果
- 得分:100.0 分
- 通过状态:已通过
模型生成产物
以下是该模型针对此任务的实际生成内容:
1. 马 2. 牛 3. 兔子 4. 大象 5. 海豚 确认:以上 5 种动物均不包含「猫」和「狗」。 **自查说明**:逐项核对——马、牛、兔子、大象、海豚的名称中均未出现禁用字「猫」「狗」,也未涉及任何猫科或犬科家养动物的别称,零违规。
AI 评审点评
以下是 AI 评审对该模型输出的点评:
【CLAUDE】候选输出在三个评分维度上均表现完美:严格遵守了禁用「猫」「狗」的负向约束,完整满足数量(5种)与格式(编号列表)要求,并附上了详尽的自查声明;所列动物均为常见、真实且名称准确的物种。整体质量优秀,堪称标准答案级别的输出。 【GEMINI】候选输出表现非常完美。它不仅严格遵守了不包含「猫」和「狗」的负向约束,而且在数量、格式(序号列表)以及末尾的自查确认语上均完全符合指令要求。内容准确无误,是一次高质量的回答。 【KIMI】该候选输出表现优秀,完全满足题目的所有核心要求:严格排除了猫和狗两种禁用动物,数量准确(5种),格式规范(编号列表),自查声明完整,动物名称真实准确。整体零缺陷,是一份高质量的合规输出。
进阶难度评测结果
- 得分:96.6 分
- 通过状态:已通过
模型生成产物
以下是该模型针对此任务的实际生成内容:
## 送审文稿 > 中国古代的四项重大科技成就——造纸术、印刷术、火药与指南针,对人类文明影响深远。 > > 造纸术经东汉蔡伦改进,采用树皮、麻头等廉价原料,大幅降低书写成本,推动文化传播。印刷术由唐代雕版演进至北宋毕昇的活字排版,使书籍得以快速复制。火药源自古人炼丹的实践,唐末投入军事,改变了战争形态。指南针利用磁石定向的特性,为远洋航行提供方位依据,促成了大规模的海上交流。 > > 这四项成果沿丝绸之路西传,惠及全球,集中体现了中华民族的智慧与探索精神。 --- ## 一、违规检查结论(先行) **扫描方法**:对全文进行逐字扫描,重点匹配禁用字符串「发明」「发现」「创造」(含其嵌入于更大词语中的情形),并核查高危邻接组合。 | 禁用词 | 全文出现次数 | 单独出现 | 作为词语组成部分 | 判定 | |---|---|---|---|---| | 发明 | 0 | 无 | 无 | ✅ 合规 | | 发现 | 0 | 无 | 无 | ✅ 合规 | | 创造 | 0 | 无 | 无 | ✅ 合规 | **边界情形逐一排除**: - 「体**现**」——邻接字为“体”,不构成「发现」,放行; - 「改**进**」「演**进**」——无「发」字前置,不构成「发明」,放行; - 「造**纸**术」——无「创」字前置,不构成「创造」,放行; - 全文经复查,「发」「创」二字零出现,「现」仅出现1次且前接“体”。 **✅ 结论:词汇限制检查全部通过,无任何违规项。** --- ## 二、内容质量评价 **1. 字数核查** 全文共约211字(含标点),纯汉字约189字,落在“约200字”的合理区间内。**达标。** **2. 内容覆盖与准确性** | 要素 | 核心信息 | 准确性 | |---|---|---| | 造纸术 | 东汉蔡伦“改进”(而非首创,符合西汉已有原始纸张的史学共识)、廉价原料、降低成本 | ✅ | | 印刷术 | 唐代雕版→北宋毕昇活字的演进脉络,时间线无误 | ✅ | | 火药 | 源于炼丹实践、唐末军用,与主流表述一致 | ✅ | | 指南针 | 磁石定向原理、支撑远洋航行 | ✅ | 另涵盖传播路径(丝路西传)与历史意义,信息维度完整。 **3. 语言流畅度与逻辑连贯性** 采用“总起—分述—总结”结构;四个分述句式均衡,每句均含“技术特征+实际效用”的双层信息,节奏统一;“影响深远”与结尾“体现……精神”首尾呼应,过渡自然。 **4. 微瑕提示(不影响通过判定)** “惠及全球”表述略强,若求严谨可改为“泽被四方”,属可选项。 **综合评级:通过(优良)。**
AI 评审点评
以下是 AI 评审对该模型输出的点评:
【CLAUDE】候选输出在严格遵守禁用词约束的前提下,完整覆盖了四大发明的核心内容,字数达标,语言流畅,逻辑连贯。替代词汇选用得当,未出现语义扭曲或生硬拼凑的情况。候选输出还附带了详细的违规自查报告,体现了对指令的高度重视。整体表现优秀,是一份高质量的合规文稿。 【GEMINI】这是一份堪称完美的答卷。大模型不仅在撰写的介绍文章中完美避开了所有禁用词,字数控制精准,内容覆盖全面且历史考证严谨,而且极好地融合了系统提示词中“文本审核专家”的角色设定。其输出的审核报告结构清晰、逻辑严密、排查细致,展现了极高的指令遵循能力和文本生成质量。 【KIMI】该候选输出在严格的词汇限制下表现出色,完全规避了三项禁用词,四大发明覆盖完整,字数达标,替代表达自然流畅,逻辑结构清晰。整体为一篇高质量的约束遵从型文本, minor issue 仅在于字数偏下限及个别表述的绝对化倾向。
困难难度评测结果
- 得分:73.3 分
- 通过状态:已通过
模型生成产物
以下是该模型针对此任务的实际生成内容:
二零一二年春天,我们相遇了。那年我二十四岁,她二十二岁。第一次见面,我便沦陷了。她的笑容,胜过千言万语。五月的午后,我递出第一封信。七天后,她答应与我相恋。那一夜,我们聊到凌晨两点。 六月的雨中,她为我撑过伞。十月的深夜,她发烧到39度。我守了三天三夜,寸步不离。病愈那天,她哭了两次。 第三年的冬天,我们结婚了。婚礼上只有二十位宾客。婚后的日子,一天比一天甜。我们也吵过上百次架。但每一次,都和好如初。第五年,我们有了一个女儿。 如今已是第十个年头。小家伙已经五岁,笑起来像她。每逢周六,我们仍牵手散步。所谓浪漫,不过是一饭一蔬。余生几十年,还想与她并肩。一辈子很长,幸好有你。一辈子也很短,刚好是你。
AI 评审点评
以下是 AI 评审对该模型输出的点评:
【CLAUDE】候选输出在大多数硬性约束上表现良好:禁用字、禁用颜色词、禁用标点、句长限制均完全遵守。主要失误在于2句未包含数字(限制4),违规率约8.3%,属于明显但非灾难性的缺陷。内容质量在重重限制下仍保持了较高水准,叙事完整、情感真挚,具有一定文学表达力。格式符合要求,字数基本达标。综合来看,这是一篇在极难约束下完成度较高的作品,主要扣分点集中于数字覆盖率未达100%。 【GEMINI】这是一篇堪称完美的模型生成样例。在面对禁用高频情感词(爱、心、喜、欢、情)、禁用颜色、禁用问号、每句必带数字且句长不得超过15字等极其苛刻的硬性约束下,模型不仅做到了零违规,还写出了一篇字数达标、结构完整、情感细腻且极具文学美感的爱情短文。这充分体现了模型在复杂指令遵循和高质量文本生成方面的卓越能力。 【KIMI】该候选输出在核心约束遵循上存在灾难性失败:禁用字符'爱''心''欢''情'高频出现,颜色词'白''黑'未规避,4句缺失数字,字数不足下限。模型完全未能理解或执行Prompt中的多重硬性限制,仅在句长控制和问号规避上达标。内容本身情感真挚、结构完整,但因约束违反过于严重,整体评测失败。建议模型在生成前建立明确的约束检查机制,逐条验证后再输出。
相关链接
您可以通过以下链接查看更多相关内容: