维普中文期刊产品整合服务
137篇 您的检索式:关键字=Hive
    题名 作者 年代 出处 被引量
1基于Hive的电力设备状态信息数据仓库显示文摘随着智能变电站的建设及其状态监测系统的发展,电力设备状态信息数据规模逐渐增大。针对现有电力数据仓库在海量状态数据存储查询和分析处理方面的不足,提出基于Hive的电力设备状态信息数据仓库及其多维数据快速查询与分析方法。通过对状态监测系统与生产管理系统(PMS)的分析,将电力设备静态信息与状态监测信息存储到Hive数据仓库中。设计了基于Hive的电力设备状态信息数据仓库的系统架构和海量状态数据存储结构,采用Hadoop分布式文件系统(HDFS)对数据进行分布式存储管理,Map Reduce作为海量数据查询分析的计算模式,HiveQL查询语言作为数据仓库的控制工具,并给出了数据仓库的工作过程。建立一个基于Hive的电力设备状态信息数据仓库实验平台,分别利用5个节点和10个节点的Hadoop集群进行测试,结果表明上述方法具有较好的扩展性,能满足大规模多维电力设备状态数据存储查询的需要。王德文 肖凯 肖磊 2013电力系统保护与控制2013,41,9:40
2一种基于HIVE和分布式集群的大量数据高效处理方法研究显示文摘为了对海量电子日志数据进行有效处理,提出一种基于HIVE和分布式集群的综合解决方案。首先,从需求分析出发,阐述了分布式集群搭建、虚拟机的Flume配置和HIVE数据处理;然后,进行数据采集和清洗、业务逻辑处理及优化、数据合并与查询。实验以统计分析网站访问排名为例,对具体的表结构和实施过程进行描述,并验证其可行性。结果表明:与其他框架相比,所提大数据综合处理方法在数据采集和日志处理方面更效率,且省去了处理业务逻辑的大量Java代码,可用性更佳。侯晓芳 王欢 李瑛 2018中国电子科学研究院学报2018,13,3:33
3基于Hadoop的高校大数据平台的设计与实现显示文摘随着信息化的推进,高校已经建设了很多信息系统,积累了大量数据。如何从海量数据中,挖掘有价值的信息,支撑智慧校园的建设,成为需要迫切解决的问题。文中就高校大数据平台的关键技术和架构进行阐述,结合高校实际情况,设计高校大数据平台架构,通过搭建Hadoop集群环境,以业务系统和平台之间的数据交互验证平台设计的可行性和优势。通过研究,文中为高校建设大数据平台提出一种设计方案,为高校信息化建设提供一种新思路。唐燕 刘仁权 王苹 2017信息技术2017,41,12:29
4基于Hadoop/Hive的web日志分析系统的设计显示文摘互联网技术的迅速发展,使得web承载的信息量呈现出爆炸式增长的趋势,因此web日志的数据量也越来愈大。如何存储、处理大规模数据就成了新的挑战。云计算技术的出现,为这类问题的解决提供了一种思路。云计算将数据通过网络分布到集群的各个计算节点上,从而完成大规模数据的存储和运算。Hadoop是一个用于构建云计算平台的流行的开源框架,广泛应用于海量数据的处理。但利用Hadoop处理数据,用户必须自己开发Map/Reduce程序。这种程序处于比较低的层次,用户不容易掌握,而且难于维护。Hive是一个基于Hadoop的开源数据仓库工具,它能够将文件映射成数据表,并提供类SQL语句,简化了用户的开发。利用Hadoop、Hive设计了一个用于处理web日志分析的系统,既充分利用了Hadoop的海量数据处理的能力,又降低了开发的难度。通过与单机实验的对比,证明系统是有效的和有价值的。刘永增 张晓景 李先毅 2011广西大学学报(自然科学版)2011,36,A01:23
5一种基于Hive日志分析的大数据存储优化方法显示文摘从2002年起,某金融机构积累了大量的银行卡支付日志数据。随着业务的不断增长,数据集高速增长,原生的Hive的查询性能已经不能令人满意。文章研究了大数据及存储的现状,提出了一种基于存储日志的分析的Hive存储格式优化方法,通过该优化方法从查询时间和存储空间利用率两方面使系统性能得到提升,提升了查询效率。论文对该金融机构原有Hive存储系统通过基于存储日志分析的Hive存储格式优化方法进行改进,通过实际数据,充分证明了该方法的可行性。王正也 李书芳 2014软件2014,35,11:21
6基于Hadoop的高校公共数据平台的构建显示文摘随着高校信息化建设的发展,数据资源出现了快速的增长。现有的存储平台已难以满足信息化数据增长的要求。文中提出一种基于云存储的公共数据平台,该平台以Hadoop为基础,通过Hive、HBase和HDFS等技术实现数据资源的统一存储和共享。实验证明,该平台性能基本可以代替传统的数据库系统和文件存储系统。胡锐 胡伏原 陈丽春 2015苏州科技学院学报(自然科学版)2015,32,3:15
7Hadoop云计算基础架构的搭建和hbase和hive的整合应用显示文摘本论文介绍一种常见的云计算分布式hadoop架构及其子项目分布式的hbase数据库和hive数据仓库,真实搭建一个hadoop云计算实验平台,并整合hbase和hive,通过创建数据表并验证实现了两数据库之间的访问,为以后的大规模的数据的存储,计算和应用创造基础。谭洁清 毛锡军 2013贵州科学2013,31,5:13
8基于Spark的大数据分析工具Hive的研究显示文摘随着数据规模的不断增大,传统的关系型数据库方法已经无法满足大数据量的数据查询需求,而基于Hadoop平台的Hive数据仓库为海量数据分析提供了方便的操作。随着实时查询需求的增加,基于Spark的Hive操作得到了很好的应用。文章主要介绍了Hive on Spark的整合步骤以及与Hadoop运行模式的比较。对MovieLens数据集的实验测试显示,新模式的执行速度提高了17.42-46.35倍,这对进一步了解Hive的运行机制及海量数据的实时分析具有重要的意义。杨宁 黄婷婷 2018计算机时代2018,,11:12
9基于分布式数据仓库的分类分析研究显示文摘针对GAC-RDB分类算法只能应用于单机版数据仓库的局限性,为了能够更方便、快捷地在云计算平台上开展数据挖掘工作,基于分布式数据仓库HBase,结合GAC-RDB分类算法的实现机理,制定适合分布式平台的运行策略,使用原生HiveQL语言提出了一种分布式GAC-RDB分类算法。实验显示,随着集群中节点的不断增加,算法的运行时间稳步下降。结果表明,在保证算法准确率的前提下,分布式数据仓库能够有效提高GACRDB分类算法的扩展性和运行效率,相对于MapReduce框架,HiveQL语言降低了对数据挖掘从业人员的技术要求,更大程度地减少了算法的开发时间,为挖掘海量数据提供了新的解决方案。李伟卫 李梅 张阳 申爱丽 2013计算机应用研究2013,30,10:10
10基于Hive的高可用双引擎数据仓库显示文摘打破信息孤岛,整合异构数据,汇聚共享交换,深度分析挖掘,提供行业领域辅助决策和态势分析具有深远的理论和应用价值.本文以中国科学院教育科研态势感知服务的实际需求为牵引,设计并实现了一套基于Hive的Hadoop/Spark双计算引擎大数据仓库,支持多种方式OLAP分析,进行了可用性、负载均衡、资源管理的优化设计,为后续进行全院数据汇聚挖掘、知识图谱构建、学科态势分析提供了平台支撑.实验表明,系统灵活高效,高可用可扩展,资源调度科学,负载均衡效果明显.李翀 张彤彤 杜伟静 刘学敏 2019计算机系统应用2019,28,9:9
11基于Hive的海量web日志分析系统设计研究显示文摘针对于传统对海量数据处理和计算的瓶颈,提出了一种基于Hive的海量web日志分析机制。通过Hadoop分布式系统架构以及Hive数据仓库对海量web日志做了分析处理,并对用户的浏览行为进行了分析研究。对用户浏览行为中的浏览量和跳出率、IP数、版块热度排行的分析结果对于网站建设和大数据分析系统优化都具有一定的指导意义。江三锋 王元亮 2015软件2015,36,4:9
12基于Hive的智慧城市数据处理技术研究与实现显示文摘对智慧城市系统中产生的大量数据进行有效的采集、合理的存储、高效精准的分析,进而对决策的做出提供合理的支持是在智慧城市建设过程中必须要解决的问题。对此,在充分理解智慧园区数据分析系统功能需求、性能需求的基础上,结合当前比较主流的数据分析方面的技术,提出了Kettle+Hive+Tableau的智慧园区数据分析解决方案。该系统具有较高的可用性、稳定性、效率以及非常高的扩展性、可移植性,不仅适合于对智慧园区的数据分析,还普遍适用于对智能化信息系统数据进行分析,具有较高的普适性、通用性。该系统通过ETL工具、数据可视化工具的应用,尽量减少在数据分析系统开发过程中代码的编写,能够适用于绝大部分有数据分析需求并且数据量较大的信息化系统。艾丽蓉 刘云峰 2018计算机技术与发展2018,28,2:8
13基于Hadoop的大数据分析平台构建研究显示文摘随着大数据时代到来,传统单机模式在处理大数据集时存在运算效率低、可扩展性差的问题。针对这种情况,研究采用云计算技术构建大数据分析平台,来挖掘数据价值,为企业决策提供科学依据。文章设计大数据分析平台总体架构,对大数据进行分析,并对分析结果进行可视化展示。李伟 孙新杰 武晋民 2017信息通信2017,30,8:8
14基于Hadoop的SQL查询引擎性能研究显示文摘Apache Hadoop处理超大规模数据集有非常出色的表现,相比较于传统的数据仓库和关系型数据库有不少优势.为了让原有业务能够充分利用Hadoop的优势,SQL-on-Hadoop系统越来越受到工业界和学术界的关注.基于Hadoop的SQL查询引擎种类繁多,各有优势,其运算引擎主要包括三种:1传统的Map/Reduce引擎;2新兴的Spark引擎;3基于shared-nothing架构的MPP引擎.本文选取了其中最有代表性的三种SQL查询引擎—Hive、Spark SQL、Impala,并使用了一种类TPC-H的测试基准对它们的决策支持能力进行测试及评估.从实验结果来看,Impala和Spark SQL相对于传统的Hive都有较大的提高,其中Impala的部分查询比Hive快了10倍以上,并且Impala在完成查询所占用的集群资源也是最少的.然而若从稳定性、易用性、兼容性和性能等多个方面进行对比,并不存在各方面均最优的查询引擎,因此在构建基于Hadoop的数据仓库系统时,推荐采用Hive+Impala或者Hive+Spark SQL的混合架构.吴黎兵 邱鑫 叶璐瑶 王晓栋 聂雷 2016华中师范大学学报(自然科学版)2016,50,2:8
15基于大数据技术的大学生就业分析系统的研究显示文摘从网络招聘网站采集招聘数据,存储于Hadoop分布式集群上,使用MapReduce程序进行清洗、转换为满足分析要求的结构化数据,最后利用数据仓库Hive从职位的区域分布、薪资分布、福利频次、技能频次等四个维度进行分析,为大学生的职业规划、技能学习和就业提供参考建议,为高校的专业建设、课程设置和人才培养提供决策支持。朱永忠 2020现代信息科技2020,4,18:8
16基于分布式存储系统的Hive与Hbase的研究显示文摘近年来,随着数据量的爆炸式增长和科技的迅速发展,快速分析大规模数据的需求加快了分布式云计算的迅速兴起。Hadoop除了有HDFS和能够支持Map Reduce的计算架构,还在这一基础上提供了数据仓库工具Hive和列式存储的非关系型数据库Hbase等。在详细介绍HDFS分布式文件系统的基础上,解析了数据仓库工具Hive和关系数据库的区别,还详细阐述了列式存储数据库Hbase的存储架构。高金标 何利力 邹云阳 2015工业控制计算机2015,28,12:7
17基于Hadoop/Hive的气象数据分布式处理研究显示文摘分布全球的气象传感器每隔一段时间就会收集大量的气象数据,历史气象数据更为庞大,如何存储和处理这些数据已成为一个难题。Hadoop的出现给人们提供了存储和分析大数据的一个利器,它利用HDFS分布式文件系统进行大数据存储,用户通过编写MapReduce程序完成大数据的分析处理。然而,对于很多用户而言,熟练掌握Java语言并编写MapReduce程序并不容易。鉴于此,利用Hive来存储和处理气象数据集。Hive是构建在Hadoop上的数据仓库框架,它支持SQL接口,可以让精通SQL技能的分析师对存放在HDFS中的大规模数据集进行查询分析。陈效杰 张金泉 2015软件导刊2015,14,8:7
18基于Hadoop的电商用户行为分析系统设计与实现显示文摘电商行业的飞速发展使得用户行为数据规模爆炸式增长,传统的IT架构模式已无法满足持续增长的数据处理需求。针对海量数据处理问题,提出一种基于Hadoop平台的电商用户行为分析模型,通过对Hadoop平台相关技术的研究,设计了包含数据采集、处理、分析及可视化一整套流程的电商用户行为分析系统,并对系统进行功能实现。最后,对该系统进行实际场景测试,结果表明,该系统能够根据不同分析需求快速得到目标数据,实现对用户行为的深度分析与挖掘,为企业调整营销策略,实现精准营销提供数据支撑。陈伟 2021宿州教育学院学报2021,24,3:7
19基于分布式Web应用的大数据日志分析方法研究显示文摘该文首先研究并使用了Flume集群将Web应用集群所产生的日志进行汇总,使用Flume内部组员Source来关联Web应用所产生的原始日志文件,并通过设计Channel管道供其进行数据传输,使用Sink来绑定其输出目的地;其次,搭建Hadoop集群并使用其内部组件HDFS来持久化Flume集群所汇总的日志数据,最后设计并搭建了基于Hive的数据仓库,依据Web应用所产生日志的数据格式,将HDFS中的原始日志数据灌入到原始数据表中,使用HiveQL对其进行分析。对网站的多维度PageView、访客的来源统计、用户关键路径转化进行了多维度且详细的数据分析。通过该文所设计并实现的数据分析实例,证明了大数据日志分析平台的可用性,解决了一般Web应用集群数据分析所难以克服的问题。孙鲁淼 2019电脑知识与技术2019,15,1X:7
20基于HBase和Hive的航班延误平台的存储方法显示文摘针对我国目前航班延误平台的移植难、可扩展性差,无法适应民航高速发展所带来的大数据量存储的现状,设计了面向大数据的跨平台、高适用性与高扩展性的航班延误平台。该平台以大数据工具Leaf Let为可视化载体,在地图界面实时显示航班轨迹并将轨迹数据加载至HBase数据库中,并且利用信息摘要算法(MD5)重新设计与优化航班数据表的行键,以解决其递增的飞行时间特性产生的'热点'问题;针对HBase过滤器多级查询的缺陷,提出了基于Solr Cloud的关联查询算法,利用Solr Cloud实现对行键与索引字段的分层存储,从而实现HBase二级快速索引;最后在HBase的历史航班数据与飞行计划数据基础上,构建基于Hive的海量航班信息数据仓库。实验结果显示,航班延误大数据平台的可扩展性与搭建的航班信息数据仓库可以满足民航对数据集中统一存储的需求,而多条件查询的响应速度与无二级索引的集群相比提高了上百倍,并且这种优势随着航班数据量的增长愈发明显。吴仁彪 刘超 屈景怡 2018计算机应用2018,38,5:6
返回顶部 每页显示:
共7页 首页 上一页 第1页 下一页 末页 /7 跳转

网站首页 | 关于我们 | 联系我们 | 产品服务 | 客服中心 | 广告服务 | 版权声明 | 网站联盟 | 友情链接 | 售卡网点

版权所有© 渝B2-20050021-1 渝公网安备 50019002500403号 违法和不良信息举报中心

互联网出版许可证 新出网证(渝)字10号 全国400电话 - 免长途话费