在一次做网站的时候 ,需要抓取一些其他网站的新闻 ,在这里介绍一种使用curl通过链接的方式去获取这个页面的所有内容,然后再通过正则匹配获取需要的内容。不是所有网站都能抓取需要有页面规律才能去抓取如下图
这种有规律的新闻列表 ,不过新闻的详情内容需要再次单独的去抓取,
$url = http://xxxx; // https://xxxx要抓取的链接 新闻列表
$url=str_replace('&','&',$url);
河南网站建设公司价格,品牌型网站建设价格,商城网站建设价格,响应式网站建设价格,河南网站设计制作
header("content-type:text/html;charset=utf-8");
curl_setopt($ch, CURLOPT_URL, $url);
curl_setopt($ch, CURLOPT_SSL_VERIFYPEER, 0);//除去https里面的s
curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);//关闭直接输出
$ html_data =curl_exec($ch);
河南网站建设公司价格,品牌型网站建设价格,商城网站建设价格,响应式网站建设价格,河南网站设计制作
curl_close($ch);//关闭会话
这里要确认是否抓取到了页面的内容 可以打印出来看一下
如果没有抓取到 要注意一下 页面的编码格式 使用iconv()转换一下内容编码
// $html_data=iconv('gbk', 'utf-8',$html_data);
$regular='#(.*?)(.*?)(.*?)(.*?)(.*?)
preg_match_all($regular,$html_data,$connect);//进行正规匹配取得自己要的内容
河南网站建设公司价格,品牌型网站建设价格,商城网站建设价格,响应式网站建设价格,河南网站设计制作
foreach($connect as $k =>$var){
if($k==2 || $k==3|| $k==5 || $k==7){
$b= array_merge(array_filter($connect[$k]));
河南网站建设公司价格,品牌型网站建设价格,商城网站建设价格,响应式网站建设价格,河南网站设计制作
得到数据数组后 就可以根据需求去添加数据了
内容详情需要抓取就获取到新闻内容页的链接 同样使用curl去获取信息
要注意的就是正则表达式里面的html需要跟页面的格式一样, 你可以去原网站点右键查看源代码,查看格式, 把要抓取的html复制下来 ,如果还是有不能抓取的内容可能就是格式不正确 有可能有的地方是少空格或者多空格, 这个时候直接在标签之间(.*?)。也可以 一点一点的匹配 看具体是哪个部分没有匹配到。
亿宏世纪网络为客户提供网站开发定制服务,网站制作居于LINUX+PHP+MYSQL框架,欢迎客户咨询我们建站热线400-800-9385
河南亿宏世纪网络科技有限公司,专注于互联网+品牌整合营销,公司拥有专业的互联网管理、运营策划、UI设计、技术开发等团队,专业从事于工业互联网的开发建设。我司拥有成熟的网络技术开发团队,针对网站开发、技术服务、网站风格定位、网站功能优化、网站推广维护等都具备很强的专业技术水平,旨在为客户提供专业的互联网应用解决方案。公司始终秉持着诚信经营、质量为先的经营理念,我们不仅提供优质的网络技术和云端供应链服务,而且还在产品的选择、应用等方面提供专业的咨询与售后服务。