-
hadoop hive
说明: Hadoop构建数据仓库实践 操作指南 大数据知识(hadoop java hive bigdata)
- 2019-04-06 09:26:20下载
- 积分:1
-
hdfs文件系统操作
提供的是Hadoop系统中的HDFS文件系统的上传下载文件,以及对文件进行操作的的Java代码。提供的是Hadoop系统中的HDFS文件系统的上传下载文件,以及对文件进行操作的的Java代码。提供的是Hadoop系统中的HDFS文件系统的上传下载文件,以及对文件进行操作的的Java代码。提供的是Hadoop系统中的HDFS文件系统的上传下载文件,以及对文件进行操作的的Java代码。
- 2022-05-21 13:24:13下载
- 积分:1
-
web访问记录分析
基于hadoop的web访问记录分析,主要实现:1.页面访问量统计 2.页面独立IP的访问统计 3.用户每小时PV的统计 4.用户来源域名的统计 5.用户的访问设备统计
- 2023-02-16 07:20:03下载
- 积分:1
-
图像文件转换为MapReduce可以读写的二进制文件代码
Hadoop的计算框架只能处理文本文件,对于图像数据不能直接处理,本代码可以实现将图像文件转换成Mapreduce可以读取的SequenceFile,其中包括单机写入和读取,以及mapreduce读取,是进行分布式处理图像数据的第一步。
- 2022-11-14 02:20:03下载
- 积分:1
-
MapReduce实现大矩阵乘法
MapReduce实现大矩阵乘法 ,即把一个大的矩阵分解成两个矩阵,通过计算两个小的矩阵就可以获得大的矩阵,可以很有效地解决大数据存储的问题。
- 2022-02-18 17:07:55下载
- 积分:1
-
wordcount.java
wordcount的源码,是在hadoop的环境下实现的,稍微做了点改进,这个算作是hadoop环境下的helloworld的程序,希望能给大家带来帮助
- 2023-01-31 23:45:04下载
- 积分:1
-
基于hadoop的单词计数
package org.apache.hadoop;
import java.io.IOException;
import java.text.DecimalFormat;
import java.util.StringTokenizer;
import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.DoubleWritable;
import org.apache.hadoop.io.IntWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.mapreduce.Reducer;
import org.apache.hadoop.mapreduce.Reducer.Context;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.jobcontrol.ControlledJob;
import org.apache.hadoop.mapreduce.lib.jobcontrol.JobControl;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;
import org.apache.hadoop.util.GenericOptionsParser;
public class WordCount {
- 2022-03-24 10:24:54下载
- 积分:1
-
java版kmeans算法以及mapreduces实现
java实现kmenas算法,有详细的注释,以及MapReduce实现Kmeans算法。
Map每读取一条数据就与聚类中心对比,求出该条记录对应的聚类中心,然后以聚类中心ID为key,该条数据为value将数据输出
利用Reduce的归并功能将相同的key(聚类中心ID相同)归并到一起,集中与该Key对应的数据,求出这些数据的平均值,输出平均值
对比Reduce求出的平均值与原来的聚类中心,如果不相同,将清空原中心的数据文件,将Reduce的结果写到中心文件中
- 2023-03-18 03:40:04下载
- 积分:1
-
hahoop源码
hadoop 源代码
- 2022-03-23 13:20:51下载
- 积分:1
-
日志合并代码
将电信实时日志 根据正则提取 然后通过mr合并,按类区分。
第一类:2016-06-02 23:44:32[02 00:27:16,496 INFO ] - [Topic2Queue.java]-[com.tydic.rtaBc.msgPrep.Topic2Queue$TopicThread]-[run]-[140] -
[消息发送完成****开始时间:1464798436495 结束时间:1464798436496 发送耗时毫秒:1 消息内容:PROD_OFFER_STRA_INST_553#|20160602002715000#|1588772703#|2#|2#|553#|52404686#~256902779#~0#~1763220#~20120829000000#~20170731000000#~48819113#~#~0#~1#~55302972867#~#~24#~1000#~553#~20120829175149#~#~20120829175102#~1#~11] 103002103002009103002009001Topic2Queue174_58_61134.64.115.174file
第二类:[0624 17:12:40 047 INFO ] com.tydic.rtaBc.msgPrep.MsgPrep - [@PH] [2016-06-24 17:12:40] [40-92815B5A8001-RTA1-29928958696021756] [P_1_MR] [1] [OFFER_PROD_INST_REL_554#|20160624170210000#|823943705#|1#|2#|554#|179490421#~286955326#~277480107#~554#~20160624170210#~20160624170210#~555913462#~A1#~286955326#~0#~#~#~#~#~70911#~12#~0#~0]
第三类:103002103002009
- 2022-02-04 07:56:15下载
- 积分:1