ACL 2022 基于最优传输的对比学习实现可解释的语义文本相似性
2022-08-05 19:01:00
近来微调预陶冶言语模子来逮捕句子 embedding 之间肖似性的设施仍然获得了 SOTA 的功效,例如 SimCSE。完全地,它们起初界说了一个句子 embedding 的肖似性分数(常用的例如余弦肖似度),然后愚弄 NLI 或者 STS 的数据集微调 BERT 模子,这里的句子 embedding 往往是通过 BERT 结果一层均匀池化或者直接取 [CLS] token 的 embedding 获得。
1. 作家以为这种设施可阐明性亏欠,平淡来说,要是不妨从 token 层面找到 cross-sentence 对齐以及筹算出各个对齐局限的紧张水平是有利于阐发句子肖似性的,目前哨法都没有做到这种 token 层面的显式 cross-sentence 对齐。合于 cross-sentence 对齐,可能深奥明白为找到两个句子间语义彼此成亲的 token pairs。
▲ 从这个图可能看出,两个句子的 sentence embedding 隔绝较小,然则从 token-level 的层面阐发可能看出明显分歧。
1. 作家起初提出了一个基于最优传输外面的阐发设施,用来阐发现有的极少 STS 设施例如 SimCSE。呈现目前均匀池化+余弦肖似度的设施存正在传输矩阵 rank=1 的题目,这使模子无法有用地将语义对齐的 token pairs 的肖似性统一到满堂的句子肖似性中。
3. 其它,作家还提出了 CLRCMD,一个比拟研习框架,用于优化句子对的 RCMD,有助于扩张句子肖似性的质地以及可阐明性。
最优传输(OT)题目有三大组件:传输前的状况 d1,传输后的状况 d2,价格矩阵 M。直观的说,最优传输题目便是求解状况 d1 变动到状况 d2,使得总价格最小的函数 T,这个 T 称为最优传输矩阵。
这个设施厉重上风正在于阐发句子肖似性的时刻可能显式地将各个 token pairs 的肖似性统一进来。
咱们将余弦肖似度+均匀池化的设施吐露为一个最优传输题目,并依照获得的传输矩阵来阐发该设施的缺陷。
古板的余弦肖似度筹算公式如下,S1 和 S2 辞别由各自的 token embedding 均匀池化获得
将余弦肖似度转换为余弦隔绝(1-cos),带入均匀池化公式,可能转化为合于 token embedding 的隔绝胸怀:
从上面等式(1)的角度来看,这个隔绝可能被阐明为一个传输题目的质朴解,个中价格矩阵和传输矩阵如下:
咱们看到,传输矩阵 T 由 token embedding 的 norms 决意。外面上,传输矩阵的秩被局限为 1,这劝止了 token 隔绝与 sentence 隔绝的有用整合。这个阐发中指出基于均匀池化的肖似度亏欠以有用地逮捕句子之间的 token 对应。
为懂得决上述阐发的题目,本文引入了一种基于最优传输的新奇的隔绝胸怀。起初界说一个思考上下文嵌入空间中语义合联性的传输题目:
1. 给定来自预陶冶言语模子的两个句子的 token embedding,咱们修建了一个价格矩阵 M(维度为 L1*L2,L1 是句子 1 的 token 长度,L2 是句子 2 的 token 长度),该矩阵用余弦隔绝编码 token 肖似性。
然而之前合于最优传输外面的钻探注解,找到最优传输矩阵 T 的筹算繁复度异常高,以是可能思考将最优传输题目的两个拘束要求减少。
这种形式获得的传输矩阵只要正在语义对齐的 token pairs 的职位会有一个非零值,以是该矩阵的秩大于 1,这意味着它可能外达两个句子之间更繁复的符号级语义合联。(之前均匀池化+余弦肖似度的设施获得的传输矩阵正在一切 token pairs 的职位都大概有非零值,外面上秩等于 1)
作家进一步提出了一个基于 RCMD 这种新奇隔绝胸怀的比拟研习框架(CLRCMD),它将 RCMD 隔绝胸怀整合到最前辈的比拟研习框架中。单纯地说便是将 SimCSE 的余弦肖似度用 RCMD 更换。
咱们对 RCMD1 和 RCMD2 举办均匀以思考两个句子之间的双向语义对齐;这正在优化经过中供给了区别的梯度信号。最终的肖似性形容为:
1. 缓解了微调经过中预陶冶语义的灾难性遗忘。CLRCMD 更新参数以提升句子肖似性的质地,同时没有摧残预陶冶 checkpoints 中的 token-level 语义。
2. CLRCMD 直接将句子对的合联性提炼谚语义对齐的符号对的合联性。从这个事理上说,咱们的上下文嵌入空间有用地从陶冶句子对中逮捕了符号级的语义合联性,从而为其句子肖似性供给了更好的阐明。
▲ 外1 陈述了每个数据集的 Spearman 合联性及其均匀值。看待公共半数据集,与最前辈的基线比拟,CLRCMD 显示出更高的合联性。
接下来,咱们权衡咱们的设施正在可阐明 STS(iSTS)工作上的职能,以验证 CLRCMD 嵌入了足够水准的可阐明性,假使没有任何合于语义对齐块对的监视(即符号的陶冶数据)。
操纵每种设施取得的对齐块对,咱们筹算对齐 F1 分数动作评估目标,它吐露人类推断与块功勋之间的类似性,结果如下外所示:
2. 相反,SimCSEavg 未能代外句子肖似性的居心义的令牌级合联性,rank-1 局限劝止了模子正在两个句子之间取得任何合理的对齐,同时它只是一次调度一切大概的符号对的功勋。
本文钻探的题目本来是一切句子级工作广泛存正在的题目,疏忽了 token-level 的可阐明性。引入最优传输外面,将 token-level 讯息统一到句子吐露中,这个思绪是较量具有更始性的。提出了一个新的比拟研习框架,调换了以往清一色的基于余弦肖似度的比拟宗旨,改用一个新奇的 RCMD 动作隔绝胸怀,这个较量居心思。
奈何能力让更众的优质内容以更短道途来到读者群体,缩短读者寻找优质内容的本钱呢?谜底便是:你不睬解的人。
总有极少你不睬解的人,理解你思理解的东西。PaperWeekly 大概可能成为一座桥梁,促使区别配景、区别宗旨的学者和学术灵感互相碰撞,迸发出更众的大概性。
PaperWeekly 煽惑高校实习室或个体,正在咱们的平台上分享种种优质内容,可能是最新论文解读,也可能是学术热门明白、科研心得或竞赛经历讲授等。咱们的主意只要一个,让常识真正活动起来。
• PaperWeekly 恭敬原作家签名权,并将为每篇被采取的原创首发稿件,供给业内具有比赛力稿酬,完全根据著作阅读量和著作质地阶梯制结算