序列标注模型

背景知识

序列标注模型被广泛应用于文本处理相关领域,例如分词、词性标注、命名实体识别等方面。现有的序列标注模型主要有HMM,MEMM 以及 CRF,通过对这几种自然语言处理中常用的序列标注模型进行对比,分析其各自的优缺点。

在介绍三种序列标注模型之前,首先需了解下产生式模型与判别式模型的概念,二者在分类器中经常被提及。假定输入,类别标签:产生式模型估计联合概率,判别式模型估计条件概率。产生式模型可以根据贝叶斯公式得到判别式模型,但反过来不行。

  1. 1.        隐马尔科夫模型(HMM

HMM是一种产生式模型,它采用一个联合概率将观测序列和状态序列结合在一起,通过训练参数来最大化拟合训练语料的联合概率,结构如图1所示。

序列标注模型

图1  HMM结构图

图中,分别表示HMM的状态值和观察值,每一个位置可以看作是一个时刻。从图中可以清楚地发现时刻的状态只取决于时刻的状态,即仅取决于,并且每个观察值只由状态值决定。即HMM是一个双重随机过程:①马尔可夫链,用来描述状态的转移;②随机过程,用来描述状态值和观察值之间的统计关系。

缺点:(1)为对联合概率分布进行建模,HMM引入两条独立性假设:第一,马尔科夫链在任意时刻的状态仅依赖于前一个状态;第二,任意时刻的观测只依赖于该时刻马尔科夫链的状态。这就导致HMM只能局限于部分上下文特征,无法充分利用更多有效的特征。(2)为定义观察值和状态值的联合概率,产生式模型必须列出所有可能的观察序列,这在实际操作中是很难实现的。

  1. 2.        最大熵隐马尔科夫模型(MEMM

最大熵马尔可夫模型是一种判别式模型,它不需要HMM那样严格的独立性假设。MEMM是基于概率有限状态模型这样一个概念,该模型将观察序列看作是条件事件,而不是由状态生成的。它结合了MEM和HMM的优点,允许状态转移可以基于输入序列中的非独立性特征,使得MEMM在处理自然语言处理的任务时,性能优于HMM。MEMM是通过求局部最优的条件概率来获得最终的条件概率。MEMM的结构如图2所示。

 

序列标注模型

图2  MEMM结构图

由图2可以看出,观察序列是作为条件,而不是生成的,因此图的分布指的是时刻状态所表示的随机变量的联合分布。

缺点:仅对局部求解条件概率,取其概率最大的标注作为最终的输出标注,导致标注偏置问题的产生,即凡是训练语料中未出现的情况全都忽略掉。

图3是一个对标记偏置进行解释的实例。

 

序列标注模型

图3    Viterbi算法解码MEMM

图3中状态1倾向于转换到状态2,同时状态2倾向于保留在状态2;但是得到的最优的状态转换路径是1->1->1->1,这是因为状态2可以转换的状态比状态1要多,从而使转移概率降低,即MEMM倾向于选择拥有更少转移的状态。这就是标记偏置问题。

  1. 3.       条件随机场模型(CRF

条件随机场也是一种判别式模型,是指在给定输入节点条件下计算输出节点的条件概率,其核心思想是利用无向图理论使序列标注的结果达到在整个序列上全局最优。CRF模型己被应用到自然语言处理的多个领域,如中文分词、命名实体识别等等。理论上,图的结构可以是任意的,但是当用于序列标记任务时,一般假设图是最简单和最通用的图结构,将其称为线性链条件随机场(Linear-chain CRF),结构如图4所示。

序列标注模型

图4  Linear-chain CRF结构

优点:无需引入独立性假设,能够充分利用上下文信息特征;计算全局最优输出节点的条件概率,克服了最大熵马尔可夫模型存在的标记偏置问题。

缺点:训练代价大、特征函数复杂度高。

总结

三种模型都可以通过Viterbi等动态规划算法求得最优值。HMM模型是对转移概率和表现概率直接建模,统计共现概率。MEMM模型是对转移概率和表现概率建立联合概率,统计的是条件概率,容易陷入局部最优。CRF模型统计了全局概率,考虑了数据在全局的分布,而不是仅仅在局部归一化,解决了MEMM中的标记偏置问题。

 

 

邹丽丽

2015.1.30

原创文章,作者:admin,如若转载,请注明出处:https://www.isclab.org.cn/2015/02/02/%e5%ba%8f%e5%88%97%e6%a0%87%e6%b3%a8%e6%a8%a1%e5%9e%8b/

(0)
adminadmin
上一篇 2015年1月29日
下一篇 2015年2月5日

相关推荐

  • 基于因果推理的对抗防御方法

    基于因果推理的对抗防御方法通过因果干预、特征解耦与不变性学习,识别并强化数据中的因果特征,抑制模型对伪相关与“捷径特征”的依赖,从而在机理上增强模型的泛化能力和抗干扰能力,使其在遭…

    2025年11月10日
    959
  • 自动化漏洞挖掘初探

    摘要:本报告介绍了web漏洞挖掘中的基本概念,实战通用方案及相关思路总结,进一步详细讲解了手工挖掘中存在的痛点问题,重点阐述了前沿自动化漏洞挖掘算法原理,分析其如何弥补手工挖掘的不…

    2023年2月13日
    1.5K
  • Android MediaRecorder架构详解

    1. 简介 在android中录制音频有两种方式,MediaRecorder和AudioRecord。两者的区别如下: (1) MediaRecorder 简单方便,不需要理会中间…

    2014年12月7日
    2.3K
  • AFL–基于覆盖的模糊测试工具

    本次报告介绍了模糊测试以及各种分类方法,并且讲解了目前流行的模糊测试工具AFL的原理,阐明了AFL工具是如何提高代码覆盖率的。针对AFL存在的测试用例生成盲目性的问题,介绍了一种基…

    2021年3月29日
    1.8K
  • 元胞自动机原理及其在显著性检测中的应用

          元胞自动机(cellular automata,CA) 是一种时间、空间、状态都离散,空间相互作用和时间因果…

    2018年11月6日
    1.6K
  • 机器学习中的多分类问题

          机器学习在现实中常常遇到多分类问题,而一些优秀的二分类学习算法(如逻辑回归,SVM等等)不支持多分类任务。一…

    2019年4月21日
    1.3K
  • active self-paced learning

          在机器学习中获得标注数据是一个重要的部分。但是在一些专业领域,标注成本高,成本高,导致了获得标注数据困难。主…

    2019年2月24日
    1.0K
  • Web中间人攻击简介

          在网络安全方面,中间人攻击(Man-in-the-Middle Attack,MITM)是一种常用的攻击手段…

    2019年4月9日
    1.3K
  • 域自适应网络框架DANE

    本次报告介绍一种域自适应网络嵌入框架DANE,该框架解决了嵌入空间偏移和嵌入分布偏移的问题。在DANE中,来自多个网络的节点通过一组共享的可学习参数被编码为向量,以便向量共享对齐的…

    2021年3月1日
    1.5K
  • 大模型赋能的模糊测试用例生成技术

    随着大模型技术的兴起和发展,软件漏洞模糊测试方法在新技术的赋能下,可以实现更好的代码覆盖率和漏洞发现数量。本次学术报告针对结合大模型实现模糊测试用例生成的方法,介绍了Fuzz4Al…

    2024年9月3日
    1.6K