例えば Seleniumで複雑なことをしようとすると driver.page_source で取得したHTMLをパースしたくなります。このような用途のために、RubyにはNokogoriというライブラリがあります。
要素セレクタは2種類
XPathまたはjQueryでもお馴染のCSSセレクタを使用できます。本ページではCSSセレクタを用いた例を示します。
解析対象HTMLの読み込み
Nokogiriの入力はUTF-8である必要があります。ちなみに出力もUTF-8です。
文字列HTMLを解析
sample.rb
#!/usr/bin/ruby
require "nokogiri"
require "selenium-webdriver"
driver = Selenium::WebDriver.for :firefox
driver.manage.timeouts.implicit_wait = 10 # seconds
driver.get "http://www.example.com/"
doc = Nokogiri::HTML driver.page_source.encode("UTF-8") # Nokogiriの入力はUTF-8
p doc.title # タイトルを解析して出力
driver.quit
出力例
$ ruby sample.rb
"Example Domain"
ファイルを読み込み
sample.rb
#!/usr/bin/ruby
require "nokogiri"
f = File.open('/Users/YourName/Desktop/example_domain.html')
doc = Nokogiri::HTML(f)
p doc.title # タイトルを解析して出力
出力例
$ ruby sample.rb
"Example Domain"
要素の選択 (CSSセレクタ)
2つのCSSセレクタメソッドがあります。
- .css('式'): 合致するすべての要素を配列で返します
- .at_css('式'): 最初に合致した要素だけを返します
コード例:
doc.css('p.sample-class').each do |sample|
p sample.to_s
end
p doc.at_css('p#sample-id').to_s
セレクト後の要素情報の取得
本文の取得
p element.text
p element.content # .textメソッドと同じ
親要素
p element.parent.to_s
タグ名
p element.name
属性値
p element['href'] # <a href="http://www.iana.org/domains/example">More information...</a>
さらなるセレクト
p doc.at_css('p#sample-id').css('a').to_s
0
Rubyを使った効率的なスクリプトの書き方を紹介
記事の執筆者にステッカーを贈る
有益な情報に対するお礼として、またはコメント欄における質問への返答に対するお礼として、 記事の読者は、執筆者に有料のステッカーを贈ることができます。
さらに詳しく →Feedbacks
ログインするとコメントを投稿できます。



