首页> 外文期刊>International journal of computers, communications and control >An Extension of the VSM Documents Representation
【24h】

An Extension of the VSM Documents Representation

机译:VSM文档表示的扩展

获取原文
           

摘要

In this paper we will present a new approach regarding the documents representation in order to be used in classification and/or clustering algorithms. In our new representation we will start from the classical "bag-of-words" representation but we will augment each word with its correspondent part-of-speech. Thus we will introduce a new concept called hyper-vectors where each document is represented in a hyper-space where each dimension is a different part-of-speech component. For each dimension the document is represented using the Vector Space Model (VSM). In this work we will use only five different parts of speech: noun, verb, adverb, adjective and others. In the hyper-space each dimension has a different weight. To compute the similarity between two documents we have developed a new hyper-cosine formula. Some interesting classification experiments are presented as validation cases.
机译:在本文中,我们将提出一种有关文档表示的新方法,以便在分类和/或聚类算法中使用。在我们的新表示中,我们将从经典的“词袋”表示开始,但是我们将使用其对应的词性来扩充每个词。因此,我们将引入一个称为超向量的新概念,其中每个文档都在一个超空间中表示,其中每个维度是不同的词性成分。对于每个维度,使用向量空间模型(VSM)表示文档。在这项工作中,我们将仅使用五个不同的语音部分:名词,动词,副词,形容词和其他。在超空间中,每个维度的权重都不同。为了计算两个文档之间的相似性,我们开发了一个新的高余弦公式。提出了一些有趣的分类实验作为验证案例。

著录项

相似文献

  • 外文文献
  • 中文文献
  • 专利
获取原文

客服邮箱:kefu@zhangqiaokeyan.com

京公网安备:11010802029741号 ICP备案号:京ICP备15016152号-6 六维联合信息科技 (北京) 有限公司©版权所有
  • 客服微信

  • 服务号