跳过带有扩展名pdf的网页，在Anemone中抓取拉链

我正在使用海葵gem（Ruby-1.8.7和Rails 3.1.1）开发爬虫。如何从抓取/下载中跳过带有扩展名pdf，doc，zip等的网页。

ext = %w(flv swf png jpg gif asx zip rar tar 7z gz jar js css dtd xsd ico raw mp3 mp4 wav wmv ape aac ac3 wma aiff mpg mpeg avi mov ogg mkv mka asx asf mp2 m1v m3u f4v pdf doc xls ppt pps bin exe rss xml) Anemone.crawl(url) do |anemone| anemone.skip_links_like /\.#{ext.join('|')}$/ ... end

Interesting Posts

在rake任务中打印到屏幕

使用Google Analytics进行Rails 4 turbolinks

gem install kgio ERROR

selenium webdriverexception

使用Regexp检查字符串是否以辅音开头

“新”我class级的class级名称

数组中的Ruby差异包括重复

在Sinatra中运行后台进程

如何使用searchkick gem在rails中映射多个属性

如何返回arrays中可能存在的一组序列号？