大学网课搜题引擎
首页
高校帮
数据采集与管理
第四章 网络爬虫工具
题目详情
多选题
( )是Hadoop的前身,是一种分布式爬虫工具,更适合集群爬取。
A
Crawler[|]Jsoup[|]Hertrix[|]Nutch
查看答案与解析
多选题
配置了Hertrix爬取设置后,在( )模块可以新建任务并运行。
多选题
运行Hertrix前首先要搭建( )运行环境。
多选题
以下哪种说法是正确的( )
多选题
配置Hertrix的爬取设置是在( )模块。
多选题
使用Hertrix爬取网页时建议使用( )模式。
多选题
网站一般在( )文件中描述被爬取的规则。
多选题
Hertrix默认的运行端口是( )
数据采集与管理
章节列表
第一章 数据采集基础
10
第二章 网络爬虫原理
8
第四章 网络爬虫工具
8