ゲストさんログイン

統合検索

ソーシャルブックマーク

[PR]興奮vs感動 どちらが勝つか!

Ads by Google

ページ詳細

32
users

Webページの本文抽出

Webページの自動カテゴライズ の続き。 前回書いたとおり、パストラックで行っている Web ページのカテゴライズでは、Web ページの本文抽出がひとつの鍵になっています。今回はその本文抽出モジュールを公開しつつ、使っている技法をざっくり解説などしてみます。 本モジュールの利用は至極簡単。require して analyse メソッドに解析したい html を与えるだけ。文字コードは UTF-8 です。 【追記】大事なこと書き忘れ。本モジュールは Ruby1.8.5 で動作確認していますが、特別なこ...


コメント

Web ページには(略)、とにかく本文以外の「ゴミ」がわんさかついているので、本文を抽出するというより「いかにゴミを取り除くか」に注力しています / セクションターゲット対応重要 ← お金の力は偉大

Extract body

Ads by Google


クリップ(27+5)
Webページの本文抽出
livedoor クリップのトップに戻る