WEB开发网
开发学院WEB开发ASP.NET 爬虫如何抓取到Asp.Net中-doPostBack获取新页面的... 阅读

爬虫如何抓取到Asp.Net中-doPostBack获取新页面的数据

 2006-12-07 17:17:51 来源:WEB开发网   
核心提示:在Web 2.0时代,很多网站采用Ajax技术实现,爬虫如何抓取到Asp.Net中-doPostBack获取新页面的数据,带来较好用户体验的代价是,javascript得到的内容搜索引擎无法爬到,那么如何指定某一页呢,Asp.Net在后台是以session方式保存当前页信息的,Google也正在研究此种技术,本文讨论a
在Web 2.0时代,很多网站采用Ajax技术实现,带来较好用户体验的代价是,javascript得到的内容搜索引擎无法爬到,Google也正在研究此种技术。本文讨论asp.net程序生成的链接,爬虫如何能爬进去的问题。
问题:某网站出现的数据列表分页显示,而上一页和下一页都是用__doPostBack提交到后台处理,如Javascript:__doPostBack('ucInfoListMore$gridInfoList$_ctl21$_ctl1',''),我们根本得不到他绝对链接的地址,而且每一页得下一页传入的参数是一样的。
分析:我们首先理解__doPostBack做了哪些事情。
function __doPostBack(eventTarget, eventArgument) {
var theform;
if (window.navigator.appName.toLowerCase().indexOf("netscape") > -1) {
theform = document.forms["Form1"];//注意此处的FormID
} else {
theform = document.Form1;//还有此处
}
theform.__EVENTTARGET.value = eventTarget.split("$").join(":");
theform.__EVENTARGUMENT.value = eventArgument;
theform.submit();
}
明白了吧,问题就在.__EVENTTARGET(后台处理的事件)和__EVENTARGUMENT上。这样就简单了,我们可以给这两个参数赋值,然后向后台发送Post就可以了。那么如何指定某一页呢,Asp.Net在后台是以session方式保存当前页信息的,我们在Post得时候能够保证实在同一个会话中进行的就可以了。
http://www.cnblogs.com/polugen/archive/2006/12/06/583861.html

Tags:爬虫 如何 抓取

编辑录入:爽爽 [复制链接] [打 印]
赞助商链接