序列标注模型

背景知识

序列标注模型被广泛应用于文本处理相关领域,例如分词、词性标注、命名实体识别等方面。现有的序列标注模型主要有HMM,MEMM 以及 CRF,通过对这几种自然语言处理中常用的序列标注模型进行对比,分析其各自的优缺点。

在介绍三种序列标注模型之前,首先需了解下产生式模型与判别式模型的概念,二者在分类器中经常被提及。假定输入,类别标签:产生式模型估计联合概率,判别式模型估计条件概率。产生式模型可以根据贝叶斯公式得到判别式模型,但反过来不行。

  1. 1.        隐马尔科夫模型(HMM)

HMM是一种产生式模型,它采用一个联合概率将观测序列和状态序列结合在一起,通过训练参数来最大化拟合训练语料的联合概率,结构如图1所示。

序列标注模型

图1  HMM结构图

图中,分别表示HMM的状态值和观察值,每一个位置可以看作是一个时刻。从图中可以清楚地发现时刻的状态只取决于时刻的状态,即仅取决于,并且每个观察值只由状态值决定。即HMM是一个双重随机过程:①马尔可夫链,用来描述状态的转移;②随机过程,用来描述状态值和观察值之间的统计关系。

缺点:(1)为对联合概率分布进行建模,HMM引入两条独立性假设:第一,马尔科夫链在任意时刻的状态仅依赖于前一个状态;第二,任意时刻的观测只依赖于该时刻马尔科夫链的状态。这就导致HMM只能局限于部分上下文特征,无法充分利用更多有效的特征。(2)为定义观察值和状态值的联合概率,产生式模型必须列出所有可能的观察序列,这在实际操作中是很难实现的。

  1. 2.        最大熵隐马尔科夫模型(MEMM)

最大熵马尔可夫模型是一种判别式模型,它不需要HMM那样严格的独立性假设。MEMM是基于概率有限状态模型这样一个概念,该模型将观察序列看作是条件事件,而不是由状态生成的。它结合了MEM和HMM的优点,允许状态转移可以基于输入序列中的非独立性特征,使得MEMM在处理自然语言处理的任务时,性能优于HMM。MEMM是通过求局部最优的条件概率来获得最终的条件概率。MEMM的结构如图2所示。

 

序列标注模型

图2  MEMM结构图

由图2可以看出,观察序列是作为条件,而不是生成的,因此图的分布指的是时刻状态所表示的随机变量的联合分布。

缺点:仅对局部求解条件概率,取其概率最大的标注作为最终的输出标注,导致标注偏置问题的产生,即凡是训练语料中未出现的情况全都忽略掉。

图3是一个对标记偏置进行解释的实例。

 

序列标注模型

图3    Viterbi算法解码MEMM

图3中状态1倾向于转换到状态2,同时状态2倾向于保留在状态2;但是得到的最优的状态转换路径是1->1->1->1,这是因为状态2可以转换的状态比状态1要多,从而使转移概率降低,即MEMM倾向于选择拥有更少转移的状态。这就是标记偏置问题。

  1. 3.       条件随机场模型(CRF)

条件随机场也是一种判别式模型,是指在给定输入节点条件下计算输出节点的条件概率,其核心思想是利用无向图理论使序列标注的结果达到在整个序列上全局最优。CRF模型己被应用到自然语言处理的多个领域,如中文分词、命名实体识别等等。理论上,图的结构可以是任意的,但是当用于序列标记任务时,一般假设图是最简单和最通用的图结构,将其称为线性链条件随机场(Linear-chain CRF),结构如图4所示。

序列标注模型

图4  Linear-chain CRF结构

优点:无需引入独立性假设,能够充分利用上下文信息特征;计算全局最优输出节点的条件概率,克服了最大熵马尔可夫模型存在的标记偏置问题。

缺点:训练代价大、特征函数复杂度高。

总结

三种模型都可以通过Viterbi等动态规划算法求得最优值。HMM模型是对转移概率和表现概率直接建模,统计共现概率。MEMM模型是对转移概率和表现概率建立联合概率,统计的是条件概率,容易陷入局部最优。CRF模型统计了全局概率,考虑了数据在全局的分布,而不是仅仅在局部归一化,解决了MEMM中的标记偏置问题。

 

 

邹丽丽

2015.1.30

原创文章,作者:admin,如若转载,请注明出处:https://www.isclab.org.cn/2015/02/02/%e5%ba%8f%e5%88%97%e6%a0%87%e6%b3%a8%e6%a8%a1%e5%9e%8b/

赞 (0)
adminadmin
上一篇 2015年1月29日
下一篇 2015年2月5日

相关推荐

  • 环境注入攻击EIA

    本次报告围绕环境注入攻击展开,首先阐述了环境注入攻击的基本概念、研究背景和研究意义,然后介绍了环境注入攻击的研究现状。接着详细介绍了EIA和eTAMP两种具备代表性的方法,包括各自…

    2026年7月27日
    847
  • APT攻击行为表示

    本报告介绍了APT攻击行为的基本概念,展示了APT攻击行为表示的方法原理,并分别讲述了面向恶意流量数据场景下的攻击行为检测技术和面向开源威胁情报场景下的攻击行为提取方法,最后简要梳…

    2024年5月19日
    3.4K
  • 面向无人机系统的漏洞挖掘

    无人机广泛应用但传统模糊测试存在物理感知盲区且飞控输入高维,漏洞难挖掘。本报告介绍两种新方法:路径规划漏洞挖掘框架 DPFuzzer 及 PID 参数规范推断技术 RouthSea…

    2026年6月1日
    1.8K
  • 文本相似度度量方法

    文本相似度度量是自然语言处理中的一个基础问题,是许多下游任务的基础,如文本分类、信息检索、对话系统、句义标注等。相似度匹配的过程包括了构造特征与度量特征两个基本步骤,其中构造特征是…

    2022年3月13日
    4.4K
  • 多模态意图识别

    聚焦多模态意图识别场景下复杂意图理解与细粒度语义推理问题,概述文本、视频、音频等模态融合中的语义异构、噪声干扰、模态冲突与粗粒度表示的局限;重点介绍 LGSRR 基于大模型引导的细…

    2026年7月13日
    1.6K
  • 平面多标签文本分类方法

    多标签文本分类是对文本信息进行组织、利用和检索的有效手段,能够提高数据处理效率,具有重要的实际价值。平面多标签文本分类是多标签分类下的子任务,标记每个给定文本与最相关的多个标签。本…

    2023年12月27日
    3.1K
  • 属性缺失异质图神经网络

    本报告主要介绍属性缺失异质图神经网络,探讨了异质图研究领域的发展历程,详细介绍了属性缺失异质图的基本概念、常用处理方法以及两种前沿的属性补全异质图神经网络。

    2025年2月20日
    3.2K
  • AFL–基于覆盖的模糊测试工具

    本次报告介绍了模糊测试以及各种分类方法,并且讲解了目前流行的模糊测试工具AFL的原理,阐明了AFL工具是如何提高代码覆盖率的。针对AFL存在的测试用例生成盲目性的问题,介绍了一种基…

    2021年3月29日
    4.1K
  • Bias-Variance trade-off

    背景 熟悉模式识别的童鞋都很清楚,在模式识别领域内存在许多的学习算法和技术。面对纷繁的算法,我们必然会产生疑问:究竟哪一个算法才是“最好的”。值的强调的是每个算法都有相应的先验假设…

    2016年1月21日
    4.0K
  • Android MediaRecorder架构详解

    1. 简介 在android中录制音频有两种方式,MediaRecorder和AudioRecord。两者的区别如下: (1) MediaRecorder 简单方便,不需要理会中间…

    2014年12月7日
    4.7K