mimo-v2.6-flash 在「社交媒体热点事件时间线摘要」的评测结果

这是该 AI 模型在此测试用例上的详细评测结果。

基本信息

  • 模型名称:mimo-v2.6-flash
  • 用例名称:社交媒体热点事件时间线摘要
  • 测试类型:文本生成
  • 评测维度:文本摘要

系统提示词(System Prompt)

这是给 AI 模型的背景设定和角色指令:

你是一名资深舆情分析专家,擅长从社交媒体信息中提取关键事实并构建清晰的事件时间线。 回答要求: 1. 严格按照帖子中的时间戳对事件进行排序,不得颠倒或遗漏任何时间节点。 2. 每个时间节点需提炼出核心信息(人物、地点、事件、结果),避免照抄原文。 3. 输出格式为结构化的时间线,使用「【时间】→ 关键信息」的形式逐条呈现。 4. 在时间线之后,提供一段不超过100字的整体事件摘要,概括事件全貌。 5. 保持客观中立,不添加原帖中未提及的信息,不进行主观推断。

用户提示词(User Prompt)

这是用户给 AI 模型的具体任务要求:

以下是关于「某城市地铁故障」事件的10条社交媒体帖子,请按时间顺序总结事件的发展过程,并提取每个阶段的关键信息点。 --- 【帖子1】 时间:2024-03-15 08:12 用户:@通勤族小王 内容:地铁3号线怎么了?我在育新站等了快20分钟了,列车还没来,站台上已经挤满了人。 【帖子2】 时间:2024-03-15 08:35 用户:@地铁官方账号 内容:【运营提示】因设备检修,3号线全线列车运行延误,预计延误15-20分钟,请乘客耐心等候,不便之处敬请谅解。 【帖子3】 时间:2024-03-15 08:47 用户:@上班族阿敏 内容:3号线还没恢复正常,我已经迟到了!公司群里好多同事都说被堵在地铁里,今天早高峰彻底乱了。 【帖子4】 时间:2024-03-15 09:05 用户:@城市交通播报 内容:受地铁3号线故障影响,周边公交线路客流量激增,多辆公交车出现严重拥挤,建议市民暂缓出行或选择其他路线。 【帖子5】 时间:2024-03-15 09:20 用户:@地铁官方账号 内容:【最新通报】经技术人员紧急排查,3号线故障原因为信号系统异常,目前维修工作正在全力推进,预计09:45前恢复正常运营。 【帖子6】 时间:2024-03-15 09:31 用户:@热心市民老张 内容:在育新站看到地铁工作人员正在疏导人群,还有工作人员在站外引导大家乘坐接驳公交,态度挺好的,点个赞。 【帖子7】 时间:2024-03-15 09:48 用户:@地铁官方账号 内容:【恢复通知】3号线信号系统故障已修复,列车现已恢复正常运营,请乘客有序乘车。感谢大家的理解与配合! 【帖子8】 时间:2024-03-15 10:05 用户:@通勤族小王 内容:终于上车了!虽然迟到了将近两个小时,但地铁已经恢复了,车厢里人还是很多,慢慢散了吧。 【帖子9】 时间:2024-03-15 10:30 用户:@本地新闻快报 内容:今日早高峰,市地铁3号线因信号系统故障导致全线延误约1.5小时,波及乘客逾万人次,地铁公司已就此次故障向公众致歉,并表示将加强设备日常维护。 【帖子10】 时间:2024-03-15 11:15 用户:@地铁官方账号 内容:【情况说明】关于今日3号线故障,我司深表歉意。故障已于09:47完全修复,本次故障共影响乘客约1.2万人次。我司将深刻反思,加大设备维护投入,确保类似事件不再发生。 --- 请完成以下两项任务: 1. 按时间顺序构建事件时间线,每个节点注明时间、信息来源(用户名)和核心事件内容。 2. 在时间线之后,用不超过100字的段落对整个事件进行总体摘要。

任务要求

AI 模型需要满足以下要求:

  1. 时间线必须包含全部10条帖子对应的10个时间节点,不得遗漏任何一条。
  2. 各时间节点必须严格按照时间戳从早到晚排列,不得出现时间倒置。
  3. 每个节点的核心信息须准确反映原帖内容,不得添加原文未提及的信息,不得张冠李戴(如将某用户的内容归到另一用户名下)。
  4. 时间线格式须清晰统一,包含时间、来源、核心内容三要素。
  5. 总体摘要须覆盖事件起因、发展、解决三个阶段,字数不超过100字。
  6. 全程保持客观中立,不加入主观评价或推断性语言。

评测结果

综合得分

该模型在此用例的得分为:97.67 分(满分 100 分),已通过

基础难度评测结果

  • 得分:97.67 分
  • 通过状态:已通过

模型生成产物

以下是该模型针对此任务的实际生成内容:

**「某城市地铁3号线故障」事件时间线** - 【2024-03-15 08:12】→ @通勤族小王:育新站乘客反映列车未到,已等候约20分钟,站台拥挤。 - 【2024-03-15 08:35】→ @地铁官方账号:发布运营提示,称因设备检修致3号线全线延误,预计延误15-20分钟。 - 【2024-03-15 08:47】→ @上班族阿敏:延误仍在持续,多名乘客上班迟到,早高峰通勤秩序受影响。 - 【2024-03-15 09:05】→ @城市交通播报:地铁故障外溢,周边公交客流激增、车辆拥挤,建议市民暂缓出行或改道。 - 【2024-03-15 09:20】→ @地铁官方账号:通报故障原因为信号系统异常,抢修进行中,预计09:45前恢复运营。 - 【2024-03-15 09:31】→ @热心市民老张:育新站内工作人员疏导人群,站外引导乘客换乘接驳公交。 - 【2024-03-15 09:48】→ @地铁官方账号:宣布信号系统故障修复,3号线恢复正常运营。 - 【2024-03-15 10:05】→ @通勤族小王:乘客迟到近两小时后成功乘车,车厢客流仍较大。 - 【2024-03-15 10:30】→ @本地新闻快报:报道故障致全线延误约1.5小时、波及逾万人次,地铁公司致歉并将加强维护。 - 【2024-03-15 11:15】→ @地铁官方账号:发布情况说明,称故障于09:47完全修复,影响乘客约1.2万人次,承诺加大设备维护投入。 **事件摘要(2024-03-15)** 早高峰期间,地铁3号线因信号系统异常全线延误,约1.2万人次受影响,并致周边公交拥挤;抢修后于09:47完全修复,地铁公司致歉并承诺加强设备维护。

AI 评审点评

以下是 AI 评审对该模型输出的点评:

【KIMI】该候选输出整体质量优秀,严格遵循了任务要求。时间线完整、排序准确、信息提取精准、格式清晰统一,摘要简明扼要且覆盖全面。在信息提取的精准度和摘要的来源标注上有极微小的提升空间,但已达到非常高的完成度。

进阶难度评测结果

  • 得分:90.8 分
  • 通过状态:已通过

模型生成产物

以下是该模型针对此任务的实际生成内容:

# 某城市(上海静安区)停电事件舆情分析报告 **分析样本**:微博 / 推特 / 知乎 共 50 条 | **事件时段**:2024-03-15 19:02 — 21:15 --- ## 任务一:信息清洗 ### 1.1 重复 / 低信息量帖子(合并去重,共 23 条,合并为 9 组) > 合并原则:语义高度重复者保留**信息密度最高**的一条为代表,合并节点采用**组内最早时间戳**。 - **G1|停电首报(2 条)** - 合并:[01]、[02] - 代表:[01] 微博 | 19:02 | @路人甲_上海 - 说明:两条内容均为"静安区突然停电"的首发现场报告,仅语言不同,[01] 时间最早,保留之;[02] 来源并列标注。 - **G2|"非爆炸"信息的民间复述与可信度评估(2 条)** - 合并:[10](19:12 推特 @shanghai_expat)、[13](19:15 知乎 @城市应急观察员) - 代表:[13] - 说明:均为对"设备故障而非爆炸"的复述+可信度判断,[13] 含信源评价,信息密度更高。合并区间 19:12–19:15。 - **G3|官方通报后的网民确认复述(3 条)** - 合并:[19](19:21)、[21](19:25)、[22](19:26) - 代表:[22] 推特 | 19:26 | @shanghai_expat - 说明:三条内容均复述"官方确认变压器故障、21:00 恢复",[22] 同时含原因与预计恢复时间,信息最完整。 - **G4|居民个体生活化碎片(3 条,低信息量)** - 合并:[11](19:13 做饭中断)、[25](19:35 外出就餐)、[33](20:14 等外卖) - 代表:[11] 微博 | 19:13 | @静安居民王女士 - 说明:同一用户的个人生活记录,不涉及事件原因、范围、处置等有效信息,合并为"居民生活影响"单一节点,覆盖 19:13–20:14。 - **G5|对"提前恢复"的网民反应(3 条,低信息量)** - 合并:[31](20:12)、[32](20:13)、[35](20:16) - 代表:[31] 微博 | 20:12 | @路人丙_南京西路 - 说明:均为对官方"可能提前恢复"通报的情绪性复述,无新增事实。 - **G6|谣言传播与信息管控观察(2 条)** - 合并:[24](19:30 知乎 @城市应急观察员)、[26](19:40 推特 @news_watcher_sh) - 代表:[24] - 说明:均评论"爆炸说被官方迅速澄清",[24] 含时间量化分析,密度更高。 - **G7|恢复供电的多源交叉确认(4 条)** - 合并:[37](20:42)、[38](20:43)、[39](20:43)、[40](20:44) - 代表:[37] 微博 | 20:42 | @路人乙_静安 - 说明:四条均为"来电了"的现场确认,语义完全重复;[37] 为首报,采用其时间戳,其余来源并列保留,构成多源互证。 - **G8|事件结束统计(2 条)** - 合并:[45](20:51 推特 @news_watcher_sh)、[46](20:55 微博 @上海本地宝官号) - 代表:[45] - 说明:均给出"历时约 1 小时 41 分钟 + 谣言问题"的同一结论,[45] 为该统计最早发布者。 - **G9|事后个人感想(2 条,低信息量)** - 合并:[48](21:05)、[49](21:10) - 代表:[48] 微博 | 21:05 | @路人丙_南京西路 - 说明:均为事件结束后的主观感受,无新增事实。 **未合并但已识别的"同源双语发布"**(保留双版本,分属中英文受众,不计入去重): - [14] 与 [15](官方首次通报)、[29] 与 [30](抢修进展)、[41] 与 [42](恢复供电) ### 1.2 存疑 / 虚假信息标注(共 6 条,全部保留并标注) - **[03] 微博 | 19:05 | @吃瓜群众007 —「存疑」** - 内容:"听说是变电站爆炸" - 判断依据:①信源为"听说"(邻居转述),无任何佐证;②19:16 起被 @上海电力官微、@SH_PowerGrid_EN 官方通报及 @电力工程师_李明 一致否定为"主变压器设备故障";③该账号于 19:18([16])自行更正。属**未经证实的听说类信息**。 - **[06] 推特 | 19:08 | @news_watcher_sh —「存疑(转述型未证实信息)」** - 内容:"Unconfirmed: explosion at substation…" -...

AI 评审点评

以下是 AI 评审对该模型输出的点评:

【CLAUDE】候选输出质量优秀,在所有四个维度上均表现出色。信息清洗深度尤为突出,对虚假信息的批判性分析(特别是[08]的多重证据链)超出了基本要求。时间线节点覆盖完整,来源标注精确。与参考答案相比,候选输出的合并组设计更为精细(9组vs3组),且对中等可信度来源的分层说明更为细致。整体达到专业舆情分析报告水准。 【GEMINI】该模型的生成质量极高,展现了卓越的信息抽取、去重清洗与时间线重建能力。对原始50条多平台社交媒体帖子的梳理条理清晰,存疑分析深入准确(特别是对[08]、[36]、[50]等关键异常帖的处理非常专业),时间线节点完整且精确对应信源,可信度评级客观严谨,完全符合专业舆情分析师的产出标准。 【KIMI】该候选输出在信息清洗的细致度和结构完整性方面表现较好,对[08]和[50]等关键帖子的处理体现了批判性分析。但在时间线节点的精简性、来源标注的精确性(尤其是合并组的来源呈现方式)、以及严格遵守'不得引入外部假设'等方面与参考答案存在明显差距。特别需要改进的是:时间线表格中的来源列应直接呈现平台+用户名而非合并组编号,合并依据需要更加严格(避免将内容差异较大的帖子强行合并),可信度评级应更加细化且避免引入原文未提及的外部信息。

困难难度评测结果

  • 得分:88.0 分
  • 通过状态:已通过

模型生成产物

以下是该模型针对此任务的实际生成内容:

# 「事件X」72小时国际社交媒体舆情分析报告 **分析范围**:微博(中文)、Twitter/X(英文)、Yahoo!知恵袋(日文)、匿名论坛 **样本量**:200条帖子(本报告引用代表性样本 P001–P025) **时间锚点规则**:所有时序节点一律以帖子原始时间戳(UTC+8)为准;帖子**内容中提及的事件时刻**(如官方通报中的「06:05」「07:50」「15:45」)仅作为文本信息引用,**不参与时间线排序**。 --- ## 〇、分析前置说明:数据边界与局限 | 限制项 | 说明 | |---|---| | 样本可见性 | 原始200条中,本节选仅展开 P001–P025;任务描述提及「3条经核查的谣言变体」,其中部分在节选中未完整展开,已在第一节显式标注 | | 第2–3日数据 | 节选中 Day2 仅见 P025,Day3 无样本,故三条时间线在 03-16 之后呈稀疏状态,**不据内容推断补全** | | 实体对齐前提 | 跨语言对齐基于共同实体:**City A/A市/A市工業区+化学物质泄漏+#EventX**;已确认三语帖子指向同一事件节点(依据:伤亡数字、疏散半径、泄漏源封堵等细节逐一吻合) | --- ## 一、虚假信息识别与剔除 ### 1.1 已识别谣言/虚假信息清单 | 编号 | 谣言内容摘要 | 源头帖子 | 传播路径 | 识别依据 | 结论 | |---|---|---|---|---|---| | **R1** | 「死亡人数超过500人,政府在封锁消息」 | **P006**(微博,匿名,06:35) | P006(微博)→ P009(论坛,07:10,【转】原帖转发无新信源)→ 交叉渗透至 Twitter 叙事(P013 08:10、P008 07:05 的「数字是谎言」框架)→ 被 P017(09:30)溯源、P019(10:30)官方定性为不实信息 | ① 无任何来源链接;②「内部消息」为典型匿名权威伪装话术;③ 转发链条无新增独立信源(P009 明确标注「实为P006原帖转发」);④ 与官方通报 P012(3死)相差两个数量级;⑤ 应急管理部 P019 明令辟谣并追责 | ❌ **已证伪** | | **R2** | 「死亡100人以上」的流传信息 | 传播节点 **P004**(Yahoo!知恵袋,匿名,06:25;源头帖本身未出现在节选中) | 未知原始源 → P004 转述提问 → 与 R1 形成「百人级—五百人级」数字升级链条 | ① 以疑问句形式传播(「本当か?」),属**二手转述型谣言**,非原创捏造;② 出现时间(06:25)早于任何官方伤亡统计(07:00 P007 仍称「正在统计」);③ 全样本无任何信源支撑 | ⭐ **低可信度/疑似谣言变体** | | **R3** | 「A市工业区发生**大规模爆炸**」(事件性质误述) | **P002**(Twitter,普通用户,06:18);P003(06:20「巨响+浓烟」为现场感官描述,未断言爆炸) | P002(英文首发定性)→ P004(日文「爆発」)→ 被 P007(07:00 官方「化工**泄漏**事故」)、P011(07:30 BBC「Chemical leak」)推翻 | ① 与官方及BBC定性(chemical leak)存在**事件性质层面的实体冲突**;② 帖文自标「Unconfirmed」;③ 后续所有官方与媒体信源均未采用「爆炸」表述 | ⭐ **低可信度(早期误传,后被纠正)** | | **R4** | 「政府隐瞒真相/官方伤亡数字是谎言」(无证据的系统性指控) | 叙事源可溯至 P006 框架;代表性节点 **P008**(Twitter,07:05)、**P013**(Twitter,08:10) | P006 → P008(#CoverUp)→ P013(#EventX + 「LIES」) | ① P008 唯一「证据」为「My cousin says」——**亲属传闻式无来源断言**;② P013 以「直播烟雾规模」的**主观视觉推断**否定统计数字,属情绪化推理;③ 两帖均使用全大写情绪化标签 | ⭐ **低可信度(情绪化叙事,非事实主张)** | > **谣言特征显式标注**:R1/R2 命中「**无来源断言 + 情绪化动员语言**」("转发扩散!");R1→P009 命中「**跨平台协同搬运**」特征(微博原帖→论坛【转】帖,格式化转发、零增量信息);R4 命中「**情绪化语言(全大写 LIES/COVERUP)+ 转述型信源**」。 ### 1.2 数据完整性声明 - 任务背景提及全量数据含 **3条经核查的谣言变体**;本节选中**完整可见的仅...

AI 评审点评

以下是 AI 评审对该模型输出的点评:

【CLAUDE】候选输出是一份高质量的舆情分析报告,在所有评分维度上均达到优秀水平。结构严格遵循系统提示要求(三线独立、时间优先、批判性思维、情绪/议题双维分析),格式规范(多级标题+表格+列表),字数充足,逻辑层次清晰无冗余。与参考答案相比,候选输出在以下方面有所超越:①明确的时间优先声明与数据边界声明;②识别了参考答案未单独列出的「事件性质误述(R3)」和「100人传言(R2)」;③8节点三语比对表比参考答案更系统;④15条可信度评估全面覆盖;⑤「辟谣语种孤岛」和「媒体时序倒挂」等风险缺口分析具有较高实践价值。主要局限为全量200条中仅节选25条可见,候选已主动声明并合理处理,不构成失分。总体而言,该报告完整满足任务所有功能要求,分析深度超出基本要求。 【GEMINI】这是一份专业水准极高的国际突发事件舆情分析报告。模型完全吃透了 System Prompt 中的所有复杂约束与规范,三维时间线严格独立且按时间戳升序呈现;跨语言对比深度指出跨语种传播中的信息差与辟谣孤岛;趋势研判精准剥离情绪与议题两个维度;可信度评估与虚假信息溯源论据坚实。排版格式严谨规范,完全符合甚至超越了任务设定标准。 【KIMI】该报告整体结构完整,Markdown格式规范,字数达标,但在核心评测维度上存在多处硬伤:一是时间线归类错误(P025误入官方线),二是谣言识别存在误判(P002早期目击帖被升格为谣言),三是跨语言整合中部分'差异'判定牵强(首发感知节点),四是可信度评估存在逻辑跳跃(P014与P024的关联)。报告展现了较强的信息整合意识和结构化输出能力,但在'严格依据帖子原始属性分类'和'避免推断性关联'方面距离专业舆情分析标准仍有差距。

相关链接

您可以通过以下链接查看更多相关内容:

加载中...