大学网课搜题引擎
首页
高校帮
数据科学与大数据技术导论
第四章 半结构化数据处理
题目详情
多选题
MapReduce 的 input split 任何时候都是一个 block。 ( )
A
对[|]错
查看答案与解析
多选题
链式MapReduce计算中,对任意一个MapReduce作业,Map和Reduce阶段可以有无限个Mapper,但Reducer只能有一个。 ( )
多选题
MapReduce适于PB级别以上的海量数据在线处理。 (离线) ( )
多选题
Mahout组件提供一些可扩展的机器学习领域经典算法的实现,帮助开发人员更加方便快捷地创建智能应用程序,其主要目标是建立可伸缩的机器学习算法。()
多选题
如果某个数据节点上的空闲空间低于特定的临界点,按照均衡策略,系统就会自动地将数据从这个数据节点移动到其他空闲的数据节点。( )
多选题
基于用户的推荐算法具体过程分为两步:第一步是相似度计算,即找到和目标用户兴趣相似的用户集合第二步是分析统计模型,找到这个集合中用户喜欢的,且目标用户没有听说过的物品推荐给目标用户。( )
多选题
数据结构上可分为:结构化数据、半结构化数据、非结构化数据 ( )
多选题
NameNode 负责管理元数据信息metadata,client 端每次读写请求,它都会从磁盘中读取或会写入 metadata 信息并反馈给 client 端。(内存中读取) ( )
多选题
聚类方法按聚类标准分可分为:统计聚类方法,概念聚类方法;按所处理聚类类型可分为:数值型数据聚类,离散型数据聚类,混合型数据聚类。( )
多选题
分类处理工作主要包括两个阶段:(一)是通过训练集和训练算法调参,训练出一个模型;(二)是用此模型对测试样本进行分类 ( )
多选题
k-means聚类算法的所有步骤如下:1先从样本集中随机选取k个样本作为簇中心。2计算所有样本与这k个“簇中心”的距离,对于每一个样本,将其划分到与其距离最近的“簇中心”所代表的簇中。3计算各个簇的新的“簇中心”。( )
多选题
Hadoop 支持数据的随机读写。(hbase支持,hadoop不支持)( )
多选题
K-means算法的核心思想是,以距离作为数据对象间相似性度量的标准,使得簇内的点尽量紧密的连在一起,簇间的距离尽量大。( )
多选题
ETL: Extract-Transform-Load,用来描述将数据从来源端经过抽取(extract)、转换(transform)、加载(load)至目的端的过程( )
多选题
HBase可以有列,可以没有列族(column family)。 (有列族) ( )
多选题
HDFS采用了主从结构模型,HDFS的集群是由数据块、名称节点和数据节点等元素组成。( )
多选题
HBase对于空(NULL)的列,不需要占用存储空间。 (没有则空不存储)( )
多选题
分类是有监督学习,有先验知识的;而聚类是无监督学习,根据特征使用分类器来分组( )
多选题
MapReduce计算过程中,相同的key默认会被发送到同一个reduce task处理。( )
多选题
基于物品的推荐算法的基本原理具体过程分为两步:()第一步是计算物品之间的相似度。第二步是根据物品的相似度和用户的历史行为给用户生成推荐列表。
多选题
聚类是一个把数据对象划分成子集的过程。聚类结果中,每个子集称之为一个簇。聚类的目标是使得同一个簇中的对象间彼此相似,但与其他簇中的对象不相似。( )
数据科学与大数据技术导论
章节列表
第一章 导论引言
10
第二章 大数据生态系统
10
第三章 结构化数据处理
35
第四章 半结构化数据处理
23
第五章 大数据应用实例
11