博客
关于我
强烈建议你试试无所不能的chatGPT,快点击我
sqoop数据导入到Hdfs 或者hive
阅读量:5070 次
发布时间:2019-06-12

本文共 2432 字,大约阅读时间需要 8 分钟。

http://www.cnblogs.com/xuyou551/p/7999773.html

 

https://www.cnblogs.com/xuyou551/p/7998846.html

1:先将mysql一张表的数据用sqoop导入到hdfs中

准备一张表 

 

需求 将 bbs_product 表中的前100条数据导 导出来  只要id  brand_id和 name 这3个字段 

        数据存在 hdfs 目录   /user/xuyou/sqoop/imp_bbs_product_sannpy_  下

bin/sqoop import \--connect jdbc:mysql://172.16.71.27:3306/babasport \--username root \--password root \--query 'select id, brand_id,name from bbs_product where $CONDITIONS LIMIT 100' \--target-dir /user/xuyou/sqoop/imp_bbs_product_sannpy_ \--delete-target-dir \--num-mappers 1 \--compress \--compression-codec org.apache.hadoop.io.compress.SnappyCodec \--fields-terminated-by '\t'

 

ps: 如果导出的数据库是mysql  则可以添加一个 属性  --direct 

1 bin/sqoop import \ 2 --connect jdbc:mysql://172.16.71.27:3306/babasport \ 3 --username root \ 4 --password root \ 5 --query 'select id, brand_id,name from bbs_product  where $CONDITIONS LIMIT 100' \ 6 --target-dir /user/xuyou/sqoop/imp_bbs_product_sannpy_ \ 7 --delete-target-dir \ 8 --num-mappers 1 \ 9 --compress \10 --compression-codec org.apache.hadoop.io.compress.SnappyCodec \11 --direct \12 --fields-terminated-by '\t'

加了 direct 属性在导出mysql数据库表中的数据会快一点 执行的是mysq自带的导出功能

第一次执行所需要的时间 

 

第二次执行所需要的时间 (加了direct属性)

 

 

执行成功

2:启动hive 在hive中创建一张表 

1 drop table if exists default.hive_bbs_product_snappy ;2 create table default.hive_bbs_product_snappy(3  id int,4  brand_id int,5   name string6 )7 ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' ;

 

3:将hdfs中的数据导入到hive中

1 load data inpath '/user/xuyou/sqoop/imp_bbs_product_sannpy_' into table default.hive_bbs_product_snappy ;

 

 4:查询  hive_bbs_product_snappy 表 

 

1 select * from hive_bbs_product_snappy;

 

 

    此时hdfs 中原数据没有了

     然后进入hive的hdfs存储位置发现 

 

注意 :sqoop 提供了 直接将mysql数据 导入 hive的 功能  底层 步骤就是以上步骤   

创建一个文件  touch test.sql     编辑文件  vi test.sql 

1 use default;2 drop table if exists default.hive_bbs_product_snappy ;3 create table default.hive_bbs_product_snappy(4 id int,5 brand_id int,6 name string7 )8 ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' ;

 

 

 在 启动hive的时候 执行 sql脚本

bin/hive -f /opt/cdh-5.3.6/sqoop-1.4.5-cdh5.3.6/test.sql

 

 

 执行sqoop直接导入hive的功能

1 bin/sqoop import \ 2 --connect jdbc:mysql://172.16.71.27:3306/babasport \ 3 --username root \ 4 --password root \ 5 --table bbs_product \ 6 --fields-terminated-by '\t' \ 7 --delete-target-dir \ 8 --num-mappers 1 \ 9 --hive-import \10 --hive-database default \11 --hive-table hive_bbs_product_snappy

 

 看日志输出可以看出 在执行map任务之后 又执行了load data 

 

 查询 hive 数据

转载于:https://www.cnblogs.com/chengjun/p/8998414.html

你可能感兴趣的文章
如何实现手游app瘦身?
查看>>
linux程序设计---序
查看>>
【字符串入门专题1】hdu3613 【一个悲伤的exkmp】
查看>>
C# Linq获取两个List或数组的差集交集
查看>>
21.Longest Palindromic Substring(最长回文子串)
查看>>
HDU 4635 Strongly connected
查看>>
ASP.NET/C#获取文章中图片的地址
查看>>
Spring MVC 入门(二)
查看>>
Java处理多人同时读写文件的文件锁处理
查看>>
格式化输出数字和时间
查看>>
页面中公用的全选按钮,单选按钮组件的编写
查看>>
判断文本框输入的文字长度
查看>>
java笔记--用ThreadLocal管理线程,Callable<V>接口实现有返回值的线程
查看>>
Scaling Pinterest - From 0 To 10s Of Billions Of Page Views A Month In Two Years
查看>>
SelectSort 选择排序
查看>>
关于android 加载https网页的问题
查看>>
BZOJ 1047 HAOI2007 理想的正方形 单调队列
查看>>
各种语言推断是否是手机设备
查看>>
这个看起来有点简单!--------实验吧
查看>>
小知识:js如何更改css样式
查看>>