高次元ベクトル空間モデルによるテキスト分類問題について : 分類性能と距離構造の漸近解析(理論・技術)

書誌事項

タイトル別名
  • A Theoretical Analysis of Document Classification based on a High-dimensional Vector Space Model : Asymptotic Analysis of Classification Performance and Distance Measures(Theory and Methodology)
  • 高次元ベクトル空間モデルによるテキスト分類問題について--分類性能と距離構造の漸近解析
  • コウジゲン ベクトル クウカン モデル ニ ヨル テキスト ブンルイ モンダイ ニ ツイテ ブンルイ セイノウ ト キョリ コウゾウ ノ ゼンキン カイセキ

この論文をさがす

抄録

近年,インターネットの普及により膨大なテキストデータからの知識発見を扱うテキストマイニングの技法が注目されている.本研究では,テキストマイニングが取り扱う問題の中でも,特に文書分類の問題を取り上げ,形態素解析後の単語の出現分布としてある確率モデルのクラスを仮定し,文書分類の性能,並びに分類に用いられる距離について漸近的な分析を行う.一般に,文書分類に不必要な単語の混入を完全に排除することは難しく,様々な重要単語の重み付け法などが提案されている.本論文で扱う最初の問題は,このような分類に不必要な単語が混入することが,文書分類に与える性能劣化の程度を把握することである.さらには,単語の出現頻度に基づく文書分類においては,個々の単語の生起頻度は少なく,多くの単語の頻度がゼロとなってしまうというスパースネスの問題がある.すなわち,このベクトル空間上で一つの文書を表す点は,ゼロを多くの要素に持つベクトルで表現される.しかし,「このような状況で,文書同士の距離による分類がある程度の分類性能を示すのは何故か」という疑問については依然として経験的な解釈が与えられているのみである.その理論的根拠を与えるため,本稿では,各要素の出現頻度を有限に保ったまま,次元数を無限大とする新たな漸近論の概念を導入することにより,スパースな文書ベクトル間の距離について解析的な性能を示す.

収録刊行物

参考文献 (37)*注記

もっと見る

詳細情報 詳細情報について

問題の指摘

ページトップへ