ACM MM 2026 | 中科大提出MEC²-TT,多模态对话系统读懂情绪演化
原创 让你更懂AI的 2026-09-01 22:10 北京

AI也能看出你在强颜欢笑

当一个人对你说“我没事”时,你真的会只相信这句话吗?
很多时候,我们并不会只关注他说了什么。声音是否在颤抖?语速是否发生变化?眼神是否回避?脸上的微笑是否有些勉强?这些语言之外的信息,往往能够提供更加丰富的情绪线索。
与此同时,人的情绪也并不是彼此独立的状态。同样是“悲伤”,它可能来自刚刚发生的坏消息,也可能是失望在多轮交流中不断累积的结果。
因此,多模态共情对话不仅需要理解用户当前是什么情绪,还需要进一步建模这种情绪如何随对话逐渐演化到当前状态。
然而,现有多模态共情回复生成(Multimodal Empathetic Response Generation,MERG)方法仍面临两个重要问题:
一方面,文本、语音和视觉可能传递并不一致甚至相互冲突的情绪信号;
另一方面,多轮对话中的情绪持续、积累与转折往往没有得到充分建模。
更进一步,即使获得了较为准确的情绪状态,模型仍需要理解情绪产生的原因、用户的潜在回应需求以及适合采用的回复策略,才能最终生成恰当的共情回应。
针对这一问题,中国科学技术大学认知智能全国重点实验室陈恩红教授团队提出了 MEC²-TT。
MEC²-TT 从跨模态情绪一致性、情绪时序演化和结构化共情推理三个层面对共情回复生成进行统一建模,使模型能够从当前多模态情绪状态出发,进一步理解其历史演化过程,并将这些信息转化为面向回复生成的结构化共情推理。
目前,该工作已被多媒体领域顶级会议 ACM MM 2026 正式接收。

论文标题:
MEC²-TT: Multimodal Emotion Consistency Correction and Trajectory Tracking for Empathetic Dialogue Generation
收录会议:
ACM MM 2026
论文作者:
Sirui Zhao, Yu Bai, Jinyang Huang, Fangyuan Liu, Feng-Qi Cui, Xinqi Chen, Guo Cheng, Tong Xu, Enhong Chen
作者单位:
University of Science and Technology of China, Hefei University of Technology, Beijing University of Technology
论文链接:
https://doi.org/10.1145/3767308.3835659

MEC²-TT:从跨模态情绪校正到轨迹感知的共情生成
MEC²-TT 主要由三个相互衔接的模块构成:Emotion Consistency Correction(ECC)、Emotion Trajectory Tracking(ETT)和 Empathetic Chain-of-Thought(ECoT)。
三者分别负责跨模态情绪一致性校正、历史情绪轨迹建模以及结构化共情推理,共同形成从情绪感知到回复生成的完整流程。

〓 MEC²-TT 的整体框架。模型首先校正文本、语音与视觉之间的情绪不一致,再追踪多轮情绪演化,并通过结构化共情推理生成最终回复。
MEC²-TT 首先分别从视频、语音和文本中提取情绪相关表示,并通过 Emotion Consistency Correction(ECC)建模不同模态之间的情绪语义一致性。
具体而言,模型将三种模态的表示分别映射为情绪概率分布,并利用 KLDivergence 衡量不同模态之间的分布差异。
模态间情绪判断越接近,一致性越高;差异越明显,则意味着它们可能正在提供相互冲突的情绪信息。
基于这种一致性关系,ECC 对不同模态特征进行自适应校正,从而缓解跨模态情绪冲突,并在保留模态互补信息的同时形成更加可靠的当前情绪表示。
然而,仅建模当前轮次仍不足以支持充分的共情理解。
MEC²-TT 进一步通过 Emotion Trajectory Tracking(ETT)将各轮校正后的情绪表示按照时间顺序组织起来,并利用时间位置编码和 Multi-Head Self-Attention 建模历史情绪之间的动态依赖。
在此基础上,模型以当前轮次的情绪表示作为 Query,通过 Cross-Attention 从历史轨迹中选择与当前状态最相关的信息。
由此,ETT 不仅保留了情绪随时间发展的整体结构,也能够突出与当前状态关联最紧密的历史情绪变化。
获得当前情绪与历史轨迹之后,MEC²-TT 并未直接生成回复,而是进一步引入 Empathetic Chain-of-Thought(ECoT),将共情生成组织为:
Event Scenario → Speaker's Emotion → Emotion Cause → Goal to Response → Strategy to Response
即依次分析事件背景、说话者情绪、情绪原因、回应目标以及回复策略。
为了使多模态情绪轨迹参与语言模型推理,MEC²-TT 使用轻量级 Linear Adapter 将 ETT 输出映射至 Qwen2.5-7B 的文本嵌入空间,并以连续 Soft Prompt 的形式参与后续 ECoT 推理和最终回复生成。
由此,MEC²-TT 形成了一条从情绪校正—轨迹建模—共情推理—回复生成逐步递进的完整链路。

〓 ECoT 通过事件、情绪、原因、目标和策略等中间过程,将多模态情绪理解进一步转化为回复生成依据。

实验表现:自动指标与人工评价的系统提升
MEC²-TT 在 AvaMERG 和 MELD 两个多模态对话数据集上进行了系统实验。
AvaMERG 包含 33,048 个对话和 152,021 条多模态 utterance;MELD 包含超过 1,400 个多人对话和约 13,000 条 utterance。

〓 MEC²-TT 在 AvaMERG 与 MELD 上的自动评价和人工评价结果。
在自动评价方面,MEC²-TT 在两个数据集上的 BLEU-1、ROUGE-1 和 BERTScore-F1 均取得最佳结果。
在 AvaMERG 上,三项指标分别达到 20.97、31.23 和 88.95;在 MELD 上分别达到 14.30、24.13 和 88.33。
相比 E3RG、EmpathyEar 以及文本大模型 Qwen3-8B,MEC²-TT 在词汇匹配和语义相似度指标上整体表现更优。
尤其是相较于 Qwen3-8B,BLEU 和 ROUGE 的明显提升表明,语音、视觉以及历史情绪变化能够为共情回复生成提供纯文本之外的有效情感与上下文信息。
同时,两个数据集上的 BERTScore-F1 均取得最佳结果,也说明这种提升不仅体现在词汇重合度上,在整体语义层面同样具有更好的匹配。
对于共情对话而言,自动指标仍难以完整反映回复是否真正符合用户的情绪状态。因此,论文进一步从 Empathy、Relevance 和 Fluency 三个维度进行了人工评价。
在 AvaMERG 上,MEC²-TT 的 Empathy 达到 3.88,为所有模型中的最佳结果,Relevance 和 Fluency 分别达到 4.07 和 4.29。
在 MELD 上,Empathy、Relevance 和 Fluency 分别达到 3.04、3.73 和 4.61,三项指标均取得最佳结果。
整体结果表明,MEC²-TT 的优势不仅体现在自动评价指标上,整体结果表明,MEC²-TT 的优势不仅体现在自动评价指标上,也得到了人工评价结果的进一步验证。
为了进一步分析各组成模块的贡献,论文还对 ECC、ETT 和 ECoT 进行了消融实验。

〓 不同模块的消融实验结果,用于分析跨模态情绪校正、情绪轨迹建模与结构化共情推理的具体贡献。
在 AvaMERG 上,完整 MEC²-TT 的 BLEU-1 为 20.97。
移除 ECC 后下降至 18.37,移除 ETT 后下降至 18.34,说明跨模态情绪一致性建模与历史情绪动态建模具有互补作用:前者提高当前情绪表示的可靠性,后者进一步引入情绪随对话演化的历史信息。
相比之下,移除 ECoT 后 BLEU-1 进一步下降至 9.86,表明仅获得可靠的多模态情绪表示和历史轨迹还不足以直接生成高质量的共情回复。
将事件、情绪、原因、回应目标和回复策略组织为结构化中间推理,是连接情绪理解与最终回复生成的重要环节。
总体来看,ECC、ETT 和 ECoT 分别从跨模态一致性、时序情绪建模和结构化共情推理三个层面提升模型能力,共同支持最终的共情回复生成。

案例分析:多模态情绪不一致下的共情回复
相比单纯的数值指标,论文中的两个案例更直观地展示了跨模态情绪校正和情绪轨迹建模为什么重要。

〓 案例分析:面对文本与非语言线索不一致时,MEC²-TT 能够识别隐藏情绪,并生成更符合用户真实感受的共情回复。
第一个案例中,用户连续熬夜一个月完成工作方案,却最终被忽视。虽然文本仍表现得相对积极,但声音颤抖、勉强微笑和明显红眼均传递出更强烈的负面情绪。
一些基线模型被表面文本误导,继续给出“保持乐观”“继续努力”一类回应。
MEC²-TT 则结合语音、视觉和历史对话,识别出更深层的愤怒与挫败,并首先确认用户所经历的不公平和失落。相比单纯的鼓励,这种回复更加符合用户真实的情绪状态。
第二个案例中,用户刚得知年迈宠物狗的检查结果很差,却突然转而谈论“烤蛋糕”。虽然文本表面更加积极,但语音中的哽咽、回避目光和擦泪表明悲伤仍在持续。
部分基线模型顺着新的话题继续回应,而 MEC²-TT 结合此前围绕宠物病情形成的情绪轨迹,将这种话题转移理解为面对悲痛时的一种应对方式,并将回复重新聚焦到用户尚未缓解的悲伤本身。

结语
MEC²-TT 并非简单增加多模态信息,而是进一步关注这些信息之间是否一致、情绪如何随对话动态演化,以及情绪理解如何最终转化为共情回复。
通过跨模态情绪一致性校正、情绪轨迹建模和结构化共情推理,MEC²-TT 构建了一条从多模态情绪感知到共情回复生成的完整链路。
这一工作表明,多模态共情对话不仅需要理解用户当前表达的内容,还需要综合考虑其非语言情绪线索和历史情绪变化,从而生成与用户真实情感状态和对话语境更加一致的回应。
更多阅读

#投 稿 通 道#
让你的文字被更多人看到
如何才能让更多的优质内容以更短路径到达读者群体,缩短读者寻找优质内容的成本呢?答案就是:你不认识的人。
总有一些你不认识的人,知道你想知道的东西。PaperWeekly 或许可以成为一座桥梁,促使不同背景、不同方向的学者和学术灵感相互碰撞,迸发出更多的可能性。
PaperWeekly 鼓励高校实验室或个人,在我们的平台上分享各类优质内容,可以是最新论文解读,也可以是学术热点剖析、科研心得或竞赛经验讲解等。我们的目的只有一个,让知识真正流动起来。
📝 稿件基本要求:
• 文章确系个人原创作品,未曾在公开渠道发表,如为其他平台已发表或待发表的文章,请明确标注
• 稿件建议以 markdown 格式撰写,文中配图以附件形式发送,要求图片清晰,无版权问题
• PaperWeekly 尊重原作者署名权,并将为每篇被采纳的原创首发稿件,提供业内具有竞争力稿酬,具体依据文章阅读量和文章质量阶梯制结算
📬 投稿通道:
• 投稿邮箱:hr@paperweekly.site
• 来稿请备注即时联系方式(微信),以便我们在稿件选用的第一时间联系作者
• 您也可以直接添加小编微信(pwbot02)快速投稿,备注:姓名-投稿

△长按添加PaperWeekly小编
🔍
现在,在「知乎」也能找到我们了
进入知乎首页搜索「PaperWeekly」
点击「关注」订阅我们的专栏吧
·



