爬虫可以爬哪些网站- ISPKEY

刚接触爬虫总会问这么一句：爬虫可以爬哪些网站，是的，爬虫作为强大的手段，哪些网站可以爬，哪些网站不能爬呢。今天来说说哪些网站可以爬吧。

1、新闻网站

新闻网站，所有网站上能看到的东西都可以收集。

可收集的内容包括:标题；作者；发布时间；新闻来源；二级标题；摘要；内容；视频网站；图片链接；语言；新闻类型；发布状态；删除状态；网站名称；内容源代码等。

2、招聘网站

招聘网站需要强调需要付费才能看到的简历，不能收集！非公开申请人的简历不能收集！

可以收集的包括:公司名称；招聘岗位；网页链接；岗位分类；工作地点；专业需求；公司介绍；交付地址；行业；工作内容；工作要求；其他信息等。

3、论坛网站

论坛网站可以收集，包括：帖子；发帖人；发帖时间；发帖数量；发帖人关注数量；发帖内容、回复内容等。

4、电子商务网站

电子商务网站能否收集需要提前与技术顾问沟通，浏览电子商务网站某产品的用户手机号码无法收集。

可收集内容：价格；名称；关键字；图片链接；付款人数；链接地址等。

5、搜索引擎类

搜索引擎要用户提供登录帐号和关键字，配置非常简单，收集时无效数据会比较多。收集到的内容当然也是可以看到的。

以上就是爬虫可以爬取的网站，借助爬虫技术，我们能够在短时间内搜集到自己想要的数据。使用爬虫时结合代理ip也是不错的选择。

（推荐操作系统：windows7系统、Python 3.9.1、DELL G3电脑。）