序列标注模型

背景知识

序列标注模型被广泛应用于文本处理相关领域,例如分词、词性标注、命名实体识别等方面。现有的序列标注模型主要有HMM,MEMM 以及 CRF,通过对这几种自然语言处理中常用的序列标注模型进行对比,分析其各自的优缺点。

在介绍三种序列标注模型之前,首先需了解下产生式模型与判别式模型的概念,二者在分类器中经常被提及。假定输入,类别标签:产生式模型估计联合概率,判别式模型估计条件概率。产生式模型可以根据贝叶斯公式得到判别式模型,但反过来不行。

  1. 1.        隐马尔科夫模型(HMM

HMM是一种产生式模型,它采用一个联合概率将观测序列和状态序列结合在一起,通过训练参数来最大化拟合训练语料的联合概率,结构如图1所示。

序列标注模型

图1  HMM结构图

图中,分别表示HMM的状态值和观察值,每一个位置可以看作是一个时刻。从图中可以清楚地发现时刻的状态只取决于时刻的状态,即仅取决于,并且每个观察值只由状态值决定。即HMM是一个双重随机过程:①马尔可夫链,用来描述状态的转移;②随机过程,用来描述状态值和观察值之间的统计关系。

缺点:(1)为对联合概率分布进行建模,HMM引入两条独立性假设:第一,马尔科夫链在任意时刻的状态仅依赖于前一个状态;第二,任意时刻的观测只依赖于该时刻马尔科夫链的状态。这就导致HMM只能局限于部分上下文特征,无法充分利用更多有效的特征。(2)为定义观察值和状态值的联合概率,产生式模型必须列出所有可能的观察序列,这在实际操作中是很难实现的。

  1. 2.        最大熵隐马尔科夫模型(MEMM

最大熵马尔可夫模型是一种判别式模型,它不需要HMM那样严格的独立性假设。MEMM是基于概率有限状态模型这样一个概念,该模型将观察序列看作是条件事件,而不是由状态生成的。它结合了MEM和HMM的优点,允许状态转移可以基于输入序列中的非独立性特征,使得MEMM在处理自然语言处理的任务时,性能优于HMM。MEMM是通过求局部最优的条件概率来获得最终的条件概率。MEMM的结构如图2所示。

 

序列标注模型

图2  MEMM结构图

由图2可以看出,观察序列是作为条件,而不是生成的,因此图的分布指的是时刻状态所表示的随机变量的联合分布。

缺点:仅对局部求解条件概率,取其概率最大的标注作为最终的输出标注,导致标注偏置问题的产生,即凡是训练语料中未出现的情况全都忽略掉。

图3是一个对标记偏置进行解释的实例。

 

序列标注模型

图3    Viterbi算法解码MEMM

图3中状态1倾向于转换到状态2,同时状态2倾向于保留在状态2;但是得到的最优的状态转换路径是1->1->1->1,这是因为状态2可以转换的状态比状态1要多,从而使转移概率降低,即MEMM倾向于选择拥有更少转移的状态。这就是标记偏置问题。

  1. 3.       条件随机场模型(CRF

条件随机场也是一种判别式模型,是指在给定输入节点条件下计算输出节点的条件概率,其核心思想是利用无向图理论使序列标注的结果达到在整个序列上全局最优。CRF模型己被应用到自然语言处理的多个领域,如中文分词、命名实体识别等等。理论上,图的结构可以是任意的,但是当用于序列标记任务时,一般假设图是最简单和最通用的图结构,将其称为线性链条件随机场(Linear-chain CRF),结构如图4所示。

序列标注模型

图4  Linear-chain CRF结构

优点:无需引入独立性假设,能够充分利用上下文信息特征;计算全局最优输出节点的条件概率,克服了最大熵马尔可夫模型存在的标记偏置问题。

缺点:训练代价大、特征函数复杂度高。

总结

三种模型都可以通过Viterbi等动态规划算法求得最优值。HMM模型是对转移概率和表现概率直接建模,统计共现概率。MEMM模型是对转移概率和表现概率建立联合概率,统计的是条件概率,容易陷入局部最优。CRF模型统计了全局概率,考虑了数据在全局的分布,而不是仅仅在局部归一化,解决了MEMM中的标记偏置问题。

 

 

邹丽丽

2015.1.30

原创文章,作者:admin,如若转载,请注明出处:https://www.isclab.org.cn/2015/02/02/%e5%ba%8f%e5%88%97%e6%a0%87%e6%b3%a8%e6%a8%a1%e5%9e%8b/

(0)
adminadmin
上一篇 2015年1月29日
下一篇 2015年2月5日

相关推荐

  • 深度神经网络模型水印保护方法

    摘要:本报告介绍了深度神经网络模型水印的基本概念和嵌入方式,并讲述了两种深度神经网络模型水印保护方法,从水印嵌入、提取和验证三个角度分析了保护模型的原理,提升对模型知识产权保护的认…

    2023年3月12日
    3.8K
  • 常用距离计算方法

      韩磊 2014/12/25

    2014年12月19日
    4.0K
  • 对抗式多任务学习

          对抗式多任务学习是针对普通的多任务学习模型在共享特征提取时,可能会被特定任务的特定特征所污染的问题所提出的,…

    2019年8月13日
    3.8K
  • 联邦学习的后门攻击方法

    联邦学习在保证数据安全和隐私的情况下解决了数据孤岛和数据碎片化问题,主要分为横向联邦学习、纵向联邦学习和联邦迁移学习。本次学术报告首先介绍联邦学习的历史现状、分类及应用场景,然后通…

    2022年8月30日
    4.0K
  • 基于深度学习的二进制函数相似性分析:深入探究两大主流研究方向

    二进制函数相似性分析在1-Day漏洞检测、代码克隆检测、恶意软件检测、软件剽窃检测和自动软件修复等多个应用领域中具有广泛的应用。本次学术报告主要讲解了二进制函数相似性分析任务的研究…

    2024年2月27日
    3.6K
  • 显式周期引导的长时序列预测

    该研究提出显式周期引导的长期时间序列预测方法,核心包括Periodformer和CycleNet两种模型。Periodformer通过周期注意力机制显式捕捉长期周期性模式,降低计算…

    2025年11月3日
    3.2K
  • 联邦学习的后门防御方法

    本报告介绍了联邦学习领域后门攻击与防御的基本概念、联邦学习的训练流程,分别聚合规则和聚类规则的后门防御算法进行具体说明,阐述了联邦学习领域后门攻击与防御的发展方向及个人思考。

    2023年4月9日
    4.0K
  • 图匹配网络

    本次学术报告旨在带领听众完成图匹配网络相关知识入门。首先介绍了图匹配网络的基本概念;随后以GMN和MGMN为例讲解了图匹配网络的两种经典范式,详细阐述了图匹配网络的基本原理和应用场…

    2023年6月19日
    3.6K
  • 逆向分析与软件保护

    逆向思维应用在学习、工作中的方方面面,学术报告中介绍了逆向分析的概念及应用,通过微信的破解演示展示了软件逆向的过程。在最后针对软件发布后可能存在的被调试、被破解风险,介绍了几种软件…

    2020年5月5日
    4.4K
  • 基于NLP的软件漏洞检测方法

    随着官方发布的漏洞数量呈现指数的增长趋势,针对漏洞检测技术的研究应运而生。漏洞种类的多样性以及检测方法的单一性导致漏洞检测结果呈现一定的局限性,随着自然语言处理技术的兴起和专家知识…

    2022年2月21日
    4.3K