テキストマイニングとは何? | テキスト太郎の日次的ブログ

テキスト太郎の日次的ブログ

毎日かけるかわかりませんが、日次的なブログにしていきたいと思います。

テキストマイニングとは何だろう?

Wikipediaで調べてみた。

テキストマイニングとは、文字列を対象としたデータマイニングのこと。
通常の文章からなるデータを単語や文節で区切り、それらの出現の頻度や共出現の相関、出現傾向、時系列などを解析することで有用な情報を取り出す、テキストデータの分析方法である。

データマイニングというのが昔からあって、データからお宝を探すというような意味だったような。
マイニングMiningという英語は、金鉱を掘るというような意味で、つまり、データからお宝を発掘するイコール有効な意味を見つけ出すとなったらしい。

データがテキストに代わってテキストマイニングとなったわけで、テキストというのは文章だから、文章を解析してお宝を見つけ出すという意味になったのだろう。

流行のSNSとかWebからテキストデータをインポートして意思決定に役立てるという手法が成功したので、テキストマイニングが脚光を浴びている。

まあ、膨大な量=ビッグデータだから、今までのやり方では解析できない性質のものであることは間違いないようだ。

おもしろそうなので、少し勉強してみることにする。