首页> 中文会议>第十六届全国计算语言学学术会议暨第五届基于自然标注大数据的自然语言处理国际学术研讨会 >基于λ-主动学习方法的中文微博分词

基于λ-主动学习方法的中文微博分词

页面导航

摘要
著录项
相似文献
相关主题

摘要

由于面向中文微博的分词标注语料相对较少,导致基于传统方法和深度学习方法的中文分词系统在微博语料上的表现效果很差.针对此问题,本文提出一种新的主动学习方法从大规模未标注语料中挑选更具标注价值的微博分词语料.该方法根据微博语料的特点,在主动学习迭代过程中引入参数λ来控制所选的重复样例的个数,确保了所选样例的多样性;同时,根据样例中字标注结果的不确定性和上下文的多样性,采用Max、Avg和AvgMax三种策略衡量样例整体的标注价值;此外,用于主动学习的初始分词器除了使用当前字的上下文作为特征外,还利用字向量自动计算当前字成为停用字的可能性作为模型的特征.实验使用NLPCC2015公开的训练语料和测试语料,结果表明,本文提出的基于主动学习的分词方法,其F值较基线系统提高了0.84％～1.49％,与目前最优的WBA主动学习方法相比提升效果更加显著.

著录项

来源
《第十六届全国计算语言学学术会议暨第五届基于自然标注大数据的自然语言处理国际学术研讨会》|2017年|1-10|共10页
会议地点南京
作者
张婧; 黄德根; 黄锴宇; 刘壮; 孟祥主;
展开▼
作者单位

中国中文信息学会;

展开▼
会议组织
正文语种
原文格式 PDF
中图分类文字信息处理;
关键词
中文分词; 主动学习; 样例多样性; 微博语料;
入库时间 2022-08-17 11:23:56

相似文献

中文文献
外文文献
专利

1. 基于改进分词标注集的中文微博命名实体识别方法 [J] . WANG Chao ,WANG Zheng . 计算机与数字工程 . 2019,第001期
2. 基于最近邻的主动学习分词方法 [J] . 梁喜涛 ,顾磊 . 计算机科学 . 2015,第006期
3. 基于分层选择策略的主动学习分词方法 [J] . 梁喜涛 ,顾磊 . 计算机应用研究 . 2015,第005期
4. 基于Multigram语言模型的主动学习中文分词 [J] . 冯冲 ,陈肇雄 ,黄河燕 . 中文信息学报 . 2006,第001期
5. 一种新的错误驱动学习方法在中文分词中的应用 [J] . 夏新松 ,肖建国 . 计算机科学 . 2006,第003期
6. 基于转换的错误学习方法在中文分词后处理中的应用 [C] . 何楠 ,毛新年 ,董远 . 第七届中文信息处理国际会议 . 2007
7. 基于规则与机器学习方法的中文微博情感分析研究 [A] . 沈磊 . 2015

基于λ-主动学习方法的中文微博分词

摘要

著录项

相似文献

相关主题

期刊订阅