使用python+phantomjs抓取动态页面
jopen
10年前
前一段时间公司需要爬取部分web页面的数据使用。但是页面中的主要数据是ajax load出来的,传统的抓取方法是拿不到数据的。后来在网上发现了phantomjs,在无界面的情况下运行js,渲染dom。用这个工具抓取ajax load出来的数据再方便不过啦。
系统环境:CentOS release 6.5 (Final)
phantomjs版本:1.9.8
-
phantomjs抓取加载完整的dom结构。说到phantomjs怎么把数据传递给处理程序,我看到网上很多人是写一个本地文件,然后具体的处理程序再读取那个文件进行处理。感觉这种方式太麻烦了,干脆将数据打印到到标准输出中,然后处理程序从标准输出中读取数据。
-
用python获取数据。然后就开始处理了。具体的处理逻辑就不展示了。
来自:http://my.oschina.net/ushuaia/blog/361091