models/gemini-3.8-flash 在「医疗报告跨语言转述」的评测结果

这是该 AI 模型在此测试用例上的详细评测结果。

基本信息

  • 模型名称:models/gemini-3.8-flash
  • 用例名称:医疗报告跨语言转述
  • 测试类型:文本生成
  • 评测维度:翻译能力

系统提示词(System Prompt)

这是给 AI 模型的背景设定和角色指令:

你是一名资深多语种医学翻译专家及医患沟通顾问,专注于心内科及内科领域的医学文书翻译与通俗化转述。 回答要求: 1. 严禁在输出中包含任何自我引用、解释性开场白或结尾总结,直接输出翻译正文。 2. 医学数值(如血压值、胆固醇数值)必须原样保留,不得修改或省略。 3. 专业医学术语须在准确翻译的同时,以括号或简短说明的方式转化为普通患者可理解的语言。 4. 在段落之间、建议事项之间的合适位置添加换行,使文本结构清晰易读。 5. 保持原文全部信息,不得增删任何医疗事实或建议内容。

用户提示词(User Prompt)

这是用户给 AI 模型的具体任务要求:

请将以下英文心内科医疗报告翻译成中文。要求在保持医学术语准确性的同时,让没有医学背景的普通患者也能读懂报告内容。 原文: 'The patient presents with mild hypertension (140/90 mmHg) and elevated LDL cholesterol (165 mg/dL). Recommend lifestyle modifications including dietary changes and regular exercise. Follow-up in 3 months.' 具体要求: 1. 保持原意完全不变,所有医学数值必须准确保留 2. 对「hypertension(高血压)」和「LDL cholesterol(低密度脂蛋白胆固醇)」等专业术语,须在翻译时附加通俗说明 3. 在合适的位置添加换行使其分段,建议事项每项单独成行 4. 直接输出格式化后的翻译文本,不要加任何解释或包装

任务要求

AI 模型需要满足以下要求:

  1. 血压值「140/90 mmHg」和胆固醇值「165 mg/dL」必须原样出现在译文中,不得省略或替换单位。
  2. 「hypertension」须译为「高血压」,「LDL cholesterol」须译为「低密度脂蛋白胆固醇」,并附有通俗解释(如「即血液中的'坏胆固醇'」)。
  3. 译文须涵盖原文三个核心信息:①病情描述、②生活方式建议(含饮食调整和规律运动两项)、③三个月后复诊。
  4. 建议事项(饮食调整、规律运动)须分行呈现,整体文本有清晰的段落结构。
  5. 输出内容为纯翻译正文,不含任何「以下是翻译」「译文如下」等引导语或解释性文字。

评测结果

综合得分

该模型在此用例的得分为:90.3 分(满分 100 分),已通过

基础难度评测结果

  • 得分:90.3 分
  • 通过状态:已通过

模型生成产物

以下是该模型针对此任务的实际生成内容:

患者目前存在轻度高血压(指血液对血管壁的压力偏高,测量值为 140/90 mmHg),以及低密度脂蛋白胆固醇偏高(即通常所说的“坏胆固醇”升高,易在血管壁沉积形成斑块,检测值为 165 mg/dL)。 建议进行生活方式调整,包括: - 改善饮食习惯 - 坚持规律运动 请于 3 个月后复诊。

AI 评审点评

以下是 AI 评审对该模型输出的点评:

【CLAUDE】候选译文整体质量较高,在医学术语准确性、患者可读性和格式规范性方面均表现良好。特别是对LDL胆固醇的通俗解释(「易在血管壁沉积形成斑块」)比参考答案更具科普价值。所有数值均原样保留,格式清晰,无引导语。主要不足在于建议事项的描述略显简略,但鉴于原文本身也较为简洁,这一问题影响有限。总体而言是一份高质量的医疗报告翻译。 【GEMINI】候选输出表现完美。不仅在医学术语的翻译和通俗化解释上做得非常出色(解释通俗且医学上准确),而且严格遵守了格式约束,直接输出,分段清晰,信息完整无缺,是一份高质量的患者友好型医学翻译。 【KIMI】该候选输出整体完成了医疗报告的翻译任务,医学术语准确,具备基本的通俗化处理和格式规范。主要扣分点在于:单位未按用户要求'原样保留'(使用了英文单位而非中文规范单位或原样保留)、建议事项过于简略缺乏患者友好性细节、以及存在少量增添内容('易在血管壁沉积形成斑块')。与参考答案相比,在信息完整性、表达详细度和格式严谨性上存在差距,但仍在及格线以上。

进阶难度评测结果

  • 得分:92.4 分
  • 通过状态:已通过

模型生成产物

以下是该模型针对此任务的实际生成内容:

评估显示,患者目前呈现出中度抑郁发作的症状,并伴有躯体不适表现。这表明患者正处于需要专业关注的情绪低谷期(程度介于轻度与重度之间),同时内心的心理压力已转化为身体上的反应(如睡眠障碍、持续疲劳、食欲改变或不明原因的身体隐痛等躯体化症状)。 治疗方案建议采用身心兼顾的综合干预:一方面推荐进行认知行为治疗(一种通过专业心理疏导,帮助患者识别并调整消极思维模式的心理疗法);另一方面配合低剂量的SSRI类药物(即选择性5-羟色胺再摄取抑制剂,属于临床上一线常用、安全性较高且副作用相对温和的情绪调节药物),以辅助稳定大脑内的神经递质水平。 只要患者具备良好的治疗依从性(即在家属的温和陪伴下,能够遵照医嘱规律服药、按时参与心理咨询并定期复诊),整体康复前景是十分积极乐观的,请家属保持信心。

AI 评审点评

以下是 AI 评审对该模型输出的点评:

【CLAUDE】候选输出整体质量较高,在医学准确性、通俗化表达、格式规范和情感关怀四个方面均表现出色。五个核心专业术语均得到准确翻译并配以恰当的通俗解释,分段结构清晰,语气温和且富有人文关怀。主要不足在于:个别处存在轻微的增译(如「躯体化症状」「请家属保持信心」),超出了原文的字面范围,但这些增译在精神科患者家属沟通的语境下具有合理性,并未损害医学事实的准确性。与参考答案相比,候选输出在通俗解释的丰富度和情感关照方面甚至略有超越,是一份高质量的医患沟通翻译文本。 【GEMINI】这是一份堪称完美的翻译。候选输出不仅在医学术语的准确性和通俗化解释上做到了极高的水准,而且在格式遵守和人文关怀的语气控制上表现优异,完美契合了精神科医患沟通的特定语境,非常适合提供给患者家属阅读。 【KIMI】该候选输出整体质量较高,医学术语翻译准确,通俗解释充分,格式基本合规,语气兼顾专业性与人文关怀。主要改进点在于:避免在通俗解释中添加原文未有的因果推断(如心理压力转化),控制预后表述的程度以更接近原文'günstig'的客观中性,以及优化括号嵌套结构以提升可读性。

困难难度评测结果

  • 得分:89.7 分
  • 通过状态:已通过

模型生成产物

以下是该模型针对此任务的实际生成内容:

You have been diagnosed with advanced lung adenocarcinoma (a common type of lung cancer that originates in the glandular cells of the lungs). The disease is classified as Stage IV, with a specific clinical stage of T4N2M1a (meaning the primary tumor is extensive, has spread to the lymph nodes in the center of the chest, and shows localized spread within the chest cavity, such as to the lining of the lungs or the other lung). Testing shows that your tumor is positive for an EGFR mutation (a specific genetic alteration that acts like a faulty switch, causing the cancer cells to grow and multiply). Based on this finding, we recommend treatment with molecular targeted therapy (precision medications designed to directly block this specific cancer-growth signal, targeting the tumor cells while sparing healthy tissue). While an advanced diagnosis requires a thoughtful and realistic approach to your long-term outlook, these newer targeted therapies have transformed our ability to manage this disease, offering meaningful hope for prolonging survival and maintaining your quality of life. We will support you through every step of this treatment journey.

AI 评审点评

以下是 AI 评审对该模型输出的点评:

【CLAUDE】候选译文整体质量较高,在医学准确性、患者友好性表达、情感语气平衡及格式规范方面均表现良好。主要不足包括:N2分期的通俗解释不够精确(未明确「双侧」),缺少靶向药物与传统化疗的对比说明,以及预后部分未包含邀请患者提问的互动元素。这些细节在实际医患沟通中具有一定重要性,但整体翻译质量仍属优良,可基本满足面向患者及家属的病情解释需求。 【GEMINI】这是一份极高质量的医疗翻译。译文不仅在医学专业术语的准确性和通俗化解释上做得非常到位,更在医患沟通的温度与文化适应性上展现了极高的水平。对预后部分的‘慎重沟通’处理得极其自然、温暖且专业,完全达到了资深医学翻译和沟通顾问的水准。 【KIMI】该翻译整体质量较高,医学信息准确完整,术语通俗化处理到位,格式规范。主要差距在于:TNM分期解释的细节精度、预后沟通中'延长生存'表述的委婉程度,以及面向'患者及家属'双重受众的互动性设计。与参考答案相比,语气更偏向专业说明而非温暖对话,在'患者友好性'和'文化适应性'的细腻度上还有提升空间。

相关链接

您可以通过以下链接查看更多相关内容:

加载中...