序列标注模型

背景知识

序列标注模型被广泛应用于文本处理相关领域,例如分词、词性标注、命名实体识别等方面。现有的序列标注模型主要有HMM,MEMM 以及 CRF,通过对这几种自然语言处理中常用的序列标注模型进行对比,分析其各自的优缺点。

在介绍三种序列标注模型之前,首先需了解下产生式模型与判别式模型的概念,二者在分类器中经常被提及。假定输入,类别标签:产生式模型估计联合概率,判别式模型估计条件概率。产生式模型可以根据贝叶斯公式得到判别式模型,但反过来不行。

  1. 1.        隐马尔科夫模型(HMM

HMM是一种产生式模型,它采用一个联合概率将观测序列和状态序列结合在一起,通过训练参数来最大化拟合训练语料的联合概率,结构如图1所示。

序列标注模型

图1  HMM结构图

图中,分别表示HMM的状态值和观察值,每一个位置可以看作是一个时刻。从图中可以清楚地发现时刻的状态只取决于时刻的状态,即仅取决于,并且每个观察值只由状态值决定。即HMM是一个双重随机过程:①马尔可夫链,用来描述状态的转移;②随机过程,用来描述状态值和观察值之间的统计关系。

缺点:(1)为对联合概率分布进行建模,HMM引入两条独立性假设:第一,马尔科夫链在任意时刻的状态仅依赖于前一个状态;第二,任意时刻的观测只依赖于该时刻马尔科夫链的状态。这就导致HMM只能局限于部分上下文特征,无法充分利用更多有效的特征。(2)为定义观察值和状态值的联合概率,产生式模型必须列出所有可能的观察序列,这在实际操作中是很难实现的。

  1. 2.        最大熵隐马尔科夫模型(MEMM

最大熵马尔可夫模型是一种判别式模型,它不需要HMM那样严格的独立性假设。MEMM是基于概率有限状态模型这样一个概念,该模型将观察序列看作是条件事件,而不是由状态生成的。它结合了MEM和HMM的优点,允许状态转移可以基于输入序列中的非独立性特征,使得MEMM在处理自然语言处理的任务时,性能优于HMM。MEMM是通过求局部最优的条件概率来获得最终的条件概率。MEMM的结构如图2所示。

 

序列标注模型

图2  MEMM结构图

由图2可以看出,观察序列是作为条件,而不是生成的,因此图的分布指的是时刻状态所表示的随机变量的联合分布。

缺点:仅对局部求解条件概率,取其概率最大的标注作为最终的输出标注,导致标注偏置问题的产生,即凡是训练语料中未出现的情况全都忽略掉。

图3是一个对标记偏置进行解释的实例。

 

序列标注模型

图3    Viterbi算法解码MEMM

图3中状态1倾向于转换到状态2,同时状态2倾向于保留在状态2;但是得到的最优的状态转换路径是1->1->1->1,这是因为状态2可以转换的状态比状态1要多,从而使转移概率降低,即MEMM倾向于选择拥有更少转移的状态。这就是标记偏置问题。

  1. 3.       条件随机场模型(CRF

条件随机场也是一种判别式模型,是指在给定输入节点条件下计算输出节点的条件概率,其核心思想是利用无向图理论使序列标注的结果达到在整个序列上全局最优。CRF模型己被应用到自然语言处理的多个领域,如中文分词、命名实体识别等等。理论上,图的结构可以是任意的,但是当用于序列标记任务时,一般假设图是最简单和最通用的图结构,将其称为线性链条件随机场(Linear-chain CRF),结构如图4所示。

序列标注模型

图4  Linear-chain CRF结构

优点:无需引入独立性假设,能够充分利用上下文信息特征;计算全局最优输出节点的条件概率,克服了最大熵马尔可夫模型存在的标记偏置问题。

缺点:训练代价大、特征函数复杂度高。

总结

三种模型都可以通过Viterbi等动态规划算法求得最优值。HMM模型是对转移概率和表现概率直接建模,统计共现概率。MEMM模型是对转移概率和表现概率建立联合概率,统计的是条件概率,容易陷入局部最优。CRF模型统计了全局概率,考虑了数据在全局的分布,而不是仅仅在局部归一化,解决了MEMM中的标记偏置问题。

 

 

邹丽丽

2015.1.30

原创文章,作者:admin,如若转载,请注明出处:https://www.isclab.org.cn/2015/02/02/%e5%ba%8f%e5%88%97%e6%a0%87%e6%b3%a8%e6%a8%a1%e5%9e%8b/

(0)
adminadmin
上一篇 2015年1月29日
下一篇 2015年2月5日

相关推荐

  • 深度神经网络模型后门攻击检测

    本报告介绍了深度学习后门攻击及其检测的基本概念、类型划分等背景知识,对2种基于主动策略的后门攻击检测算法进行了具体说明,阐述了对于深度学习后门攻击检测的发展趋势和未来前景。

    2023年11月3日
    2.7K
  • Glibc内存管理1

          内存管理是指软件运行时对计算机内存资源的分配和使用的技术。其最主要的目的是如何高效,快速的分配,并且在适当的…

    2019年6月13日
    2.2K
  • 超参数优化

    本次报告介绍了超参数的概念和对模型的影响,解释了超参数与模型参数的区别,详细讲解了网格搜索、随机搜索、贝叶斯优化三种优化方法,分析其使用场景及优缺点,最后列举了三种实用的开源调优工…

    2023年1月2日
    2.0K
  • Deep Learning词向量生成–CBOW和Skip-gram

      Deep Learning词向量生成的方法通过神经网络模型让机器自动学习到每个词有效的特征表示,而CBOW模型和Skip-gram模型是目前最流行、常用的Deep learni…

    学术报告 2017年10月13日
    2.1K
  • 不规则多元时间序列预测研究

    时序数据预测任务是时间序列处理领域中一项基本的任务,根据历史时间段数据序列预测未来一段时间的数据序列,广泛应用于天气预报、经济预测、医疗保健预测等领域。在复杂的现实世界中,时序数据…

    2024年3月15日
    2.7K
  • active self-paced learning

          在机器学习中获得标注数据是一个重要的部分。但是在一些专业领域,标注成本高,成本高,导致了获得标注数据困难。主…

    2019年2月24日
    1.8K
  • 第三方库检测技术研究

    第三方库检测技术是一个自动识别应用程序或二进制程序中,所包含的第三方库的技术。对二进制文件或APP进行分析,主要用于安全性评估、软件合规性检查以及漏洞管理。通过本次学术报告对第三方…

    2025年7月15日
    1.9K
  • Web中间人攻击简介

          在网络安全方面,中间人攻击(Man-in-the-Middle Attack,MITM)是一种常用的攻击手段…

    2019年4月9日
    2.1K
  • 软件漏洞检测及其严重性评估

    本报告介绍了漏洞检测的基本方法以及基于漏洞代码的漏洞评估的概念和评估方法。针对一种漏洞检测方式和一种漏洞评估方式进行了深入讲解,并探讨了漏洞检测和评估领域的现状,提出了一些未来发展…

    2023年3月27日
    2.2K
  • 服务端模板注入漏洞

          服务端模板注入是攻击者通过与服务端模板的输入输出交互,在过滤不严格的情况下,构造恶意输入数据,从而达到获取关…

    2019年4月16日
    2.0K