解决hive中导入text文件遇到的坑-巨人网络通讯

主页 > 知识库 > 解决hive中导入text文件遇到的坑

解决hive中导入text文件遇到的坑

今天帮一同学导入一个excel数据，我把excel保存为txt格式，然后建表导入，失败！分隔符格式不匹配，无法导入！！！！怎么看两边都是\t，怎么不匹配呢？

做为程序员，最不怕的就是失败，因为我们有一颗勇敢的心！再来！又特么失败。。。

想了好久，看看了看我的表格式，我犯了一个好低级的错误：

hive表的存储格式设置为了orcfile!!!

众所周知：orcfile为压缩格式，可以节约大量存储空间，但orc还有个特点就是不能直接load数据！要想load数据，我们要建一个存储格式为textfile的中间表，然后再把数据抽取过去。因为这个错误太简单，网上有相关科普，因此很少有把它当错误写出来。遇到问题的朋友们可能要走些弯路，我来补个漏~~~~~~

举个栗子：

1.首先，导出excel表格为txt格式，（这个过程不再赘述，网上教程一大把）。

123,小明,666,1990-09-23 12:00:18
256,小伙,555,1989-10-06 03:57:32
142,小兰,444,1992-07-04 05:05:45

2.在hive中创建表模型：

CREATE TABLE IF NOT EXISTS STUDENTS
(
ID INT COMMENT'学生',
SNAME STRING COMMENT '姓名',
SCORE INT COMMENT '得分',
STIME STRING COMMENT '考试时间'
)
ROW FORMAT DELIMITED FIELDS TERMINATED BY ','
STORED AS ORCFILE;

3.创建临时表（中间表）：

CREATE TABLE IF NOT EXISTS STUDENTS_TMP
(
ID INT COMMENT'学生',
SNAME STRING COMMENT '姓名',
SCORE INT COMMENT '得分',
STIME STRING COMMENT '考试时间'
)
ROW FORMAT DELIMITED FIELDS TERMINATED BY ','
STORED AS TEXTFILE;

与目标表只有名称和存储格式不同，其他都相同。

4.load 数据到临时表：

load data local inpath '/export/data/1.txt' into table students_tmp;

5.将数据导入目标表：

insert overwrite table students select * from students_tmp;

6.然后查看表数据，大功造成：

hive > select * from students;
OK
123 小明 666 1990-09-23 12:00:18
256 小伙 555 1989-10-06 03:57:32
142 小兰 444 1992-07-04 05:05:45
Time taken: 0.26 seconds, Fetched: 3 row(s)

其他存储格式如 SEQUENCEFILE、PARQUET 等，也要选存储为textfile格式，然后抽入目标表。

一定要按照导出格式的分隔符建表，不然load数据必然出错或全是null;

excel导出格式：

格式 分隔符 中文名称
text \t  制表符
csv , 逗号

7.还要注意一点是我们从excel导出的文件格式是gb2312 （无论是txt还是csv都是这个格式，都需要转码），我们需要把它转成utf-8才能Load。

所以在load之前，我们一般会采取两种办法：

1. 在文本编辑器中进行转码，带不带bom关系不大，然后上传;

2.在文件所在本地目录下执行以下命令转码：

piconv -f gb2312 -t UTF-8 1.txt > 2.txt

注意，在本地目录下命令转码会改变文件名，因为此命令会把所文件写入到另一个文件，并清空原文件内容，如果我们不改名，文件内容会完全丢失。所以，我们Load的时候一定要选择修改后的文件名哦。

示例：

转码前数据：

hive> select * from students;
OK
112	С��	35	2017/8/19 15:30
113	����	45	
114	³��	55	2017/8/21 15:30
115	����	NULL	
116	������	75	2017/8/23 15:30
117	������	85	2017/8/24 15:30
118	�˽�	NULL	2017/8/25 15:30
119	������	90	
120	СѾ	NULL	2017/8/27 15:30
121	����	80	2017/8/28 15:30
122	��߸	75	
123	��«��	70	2017/8/30 15:30
124	����	NULL	2017/8/31 15:30
125	�繤	NULL	
126	�峤	NULL	2017/9/2 15:30
127	˾��	50	2017/9/3 15:30
128	������	58	2017/9/4 15:30
129	����	66	2017/9/5 15:30
Time taken: 0.134 seconds, Fetched: 18 row(s)

去所在目录下转码，再Load

piconv -f gb2312 -t UTF-8 2.csv > 3.csv
# 在hive中选择正确的文件Load:
hive> load data local inpath '/export/data/3.csv' into table students;

结果：

hive> select * from students;
OK
112	小宝	35	2017/8/19 15:30
113	王明	45	
114	鲁班	55	2017/8/21 15:30
115	苗苗	NULL	
116	少林寺	75	2017/8/23 15:30
117	体育界	85	2017/8/24 15:30
118	八戒	NULL	2017/8/25 15:30
119	周芷若	90	
120	小丫	NULL	2017/8/27 15:30
121	海宝	80	2017/8/28 15:30
122	哪吒	75	
123	葫芦娃	70	2017/8/30 15:30
124	丹枫	NULL	2017/8/31 15:30
125	电工	NULL	
126	村长	NULL	2017/9/2 15:30
127	司机	50	2017/9/3 15:30
128	王世间	58	2017/9/4 15:30
129	松鼠	66	2017/9/5 15:30
Time taken: 0.106 seconds, Fetched: 18 row(s)

补充：hive导入数据出现NULL

在把hdfs上数据迁移到hive中的表时，若出现数据位NULL，是因为没有指定列分隔符。

由于hive默认的分隔符是/u0001（Ctrl+A）,为了平滑迁移，需要在创建表格时指定数据的分割符号，语法如下：

hive (default)> create external table et (time BIGINT, userid string, content string, urlrank int, urlnum int, url string)
  > partitioned by (filenum int) 
  > row format delimited fields terminated by '\t';

上面创建的是外部表，“导入”数据时可以用load，但若不想进行移动数据，就用命令alter来进行指向：

alter table et add partition (filenum=1) location '/input/SogouQueryLog/file1';

注意location后面跟的地址必须是个目录，若不是，可以用hdfs fs -mv src dest 进行移动数据：

hadoop fs -mv /input/SogouQueryLog/querylog_1 /input/SogouQueryLog/file1

以上为个人经验，希望能给大家一个参考，也希望大家多多支持脚本之家。如有错误或未考虑完全的地方，望不吝赐教。

您可能感兴趣的文章:

在python中使用pyspark读写Hive数据操作
使用Python构造hive insert语句说明
python3.6.5基于kerberos认证的hive和hdfs连接调用方式
python 实现 hive中类似 lateral view explode的功能示例
Python pandas 列转行操作详解(类似hive中explode方法)

标签：日照安庆白城锦州随州西安天水股票

巨人网络通讯声明：本文标题《解决hive中导入text文件遇到的坑》，本文关键词解决,hive,中,导入,text,文件,；如发现本文内容存在版权问题，烦请提供相关信息告之我们，我们将及时沟通与处理。本站内容系统采集于网络，涉及言论、版权与本站无关。

下面列出与本文章《解决hive中导入text文件遇到的坑》相关的同类信息！

解决hive中导入text文件遇到的坑

今天帮一同学导入一个excel数据，我把excel保存为txt格式，然后建表导入，失败！分隔符格式不匹配，无法导入！！！！怎么看两边都是\t，怎么不匹配呢？做为程序员，最不怕的就是失...

10-18

电销卡代理商湛江店（销售电销卡）

本文目录一览： 1、湛江哪里有沟通100营业厅，我想办全球通卡。2、电销卡不封号卡哪里有卖3、电销卡在哪里办理4、长江电...

04-22

移动蓝星卡9元套餐怎么样?

现在有很多的流量卡月租非常便宜，但是像移动蓝星卡这样只要9元月租的卡也是很少的，接下来我们来看下移动蓝星卡9元套...

10-20

WinXP系统提示werfault.exe应用程序错误该怎么办?

电脑总是提示werfault.exe应用程序错误该怎么办？请问图片中是什么原因？截图是程序错误（内存不能读）。首先要知道werf...

10-20

Win10 Build 10125测试版修复了斯巴达项目存在的大问题

Windows 10 Build 10125测试版刚刚在互联网上泄露，感兴趣的可以下载安装（Win10 Build 10125 86/64位ios镜像下载），它可能没有的新功...

10-20

常州客服外呼系统开发（常州呼叫中心）

本文目录一览： 1、外呼系统怎么办理？2、哪些电话外呼系统及电话销售系统好使？而且功能完善？3、外呼系统哪家公司做...

11-27

诚信可靠的电销外呼系统（电话销售外呼系统软件电销网）

本文目录一览： 1、电销外呼体系哪个好了？市面上的太多了！有能够引荐的吗？2、有靠谱的外呼体系吗，别让我再办卡，公...

11-28

电销卡为什么要收费用？

相信很多没有用过电销卡的朋友，第一次买卡都会有这个疑问，就是电销卡为什么要收取一个额外的费用呢？有这个疑问也不...

05-30

佛山人工外呼系统怎么样（广州外呼系统哪里有）

今天给各位分享佛山人工外呼系统怎么样的知识，其中也会对广州外呼系统哪里有进行解释，如果能碰巧解决你现在面临的问...

11-06

电销免封号好用吗

电销免封号好用吗电销卡的使用成本相对来说是比较低的，一般来说都是套餐服务，一个外呼电话也就几分钱，所以这样也...

12-16

Centos系统用户密码字符串生成命令-shadow

这两天在看puppet，准备用这个管理我手下系统的用户添加分配与删除工作，不过每次要是都用系统的passwd命令生成用户密码那...

10-20

安阳ai电话机器人加盟（安阳ai电话机器人加盟店）

本篇文章给咱们谈谈安阳AI电话机器人加盟，以及安阳ai电话机器人加盟店对应的知识点，希望对各位有所协助，不要忘了保...

06-12

汕头电销卡外呼系统厂家（电销外呼是什么）

07-10

400电话对企业的好处用代理商安装400电话怎样？怎样选择代理商？

400电话不会占线，这样可以有效的增加用户的体验，也可以直接提升企业的业务量，所以400电话的优势对于企业来说有着极大...

01-12

无锡联通电销线路办理多少钱,呼叫中心系统哪家好-大家都知道

无锡联通电销线路办理多少钱,呼叫中心系统哪家好怎样去了解呼叫中心是最快的途径？这个其实都不我们说，您就会知道，...

12-16

携程商户怎么显示到高德地图？携程地图商户位置服务？

请问：携程的酒店定位？您好您可以致电酒店问一下具体位置使用百度地图查询会更加准确手机携程如何连接百度地图？...

11-26

丽江语音电销机器人（电销机器人电话机器人）

本文目录一览： 1、电销板滞人运用成就怎样样 2、电销板滞人是什么？ 3、电销板滞人怎样样？ 4、电销板滞人有什么听命...

11-25

包含催收外呼系统联系方式的词条

本篇文章给我们谈谈催收外呼体系联络方法，以及对应的知识点，期望对各位有所协助，不要忘了保藏本站喔。本文目录一...

05-18

如何成为一名客服“神枪手”

“我们都是神枪手，每一颗子弹消灭一个敌人”，这是经典红色歌曲《游击队之歌》当中的一句歌词。作为客服行业从业者，...

10-22

400电话办理怎样选择适合套餐企业400电话申请的套餐选择

选择合适的400电话套餐，不仅可以为企业节省成本，避免浪费，还可以满足企业的所有需求。面对10多个400电话套餐，我该如...

01-12

ai电话机器人讯飞（ai语音电话机器人）

本篇文章给咱们谈谈ai电话机器人讯飞，以及ai语音电话机器人对应的知识点，期望对各位有所协助，不要忘了保藏本站喔。...

05-17

电话机器人在自来水客服中心的应用

随着技术的进步，人工智能已经开始走入我们的生活，而且正以一种磁悬浮般的速度向我们奔来。人工智能将会为我们带来哪...

10-24

金华稳定电话呼叫软件多少钱,呼叫中心系统办理多少钱-了解详情

金华稳定电话呼叫软件多少钱,呼叫中心系统办理多少钱大家知道一个电子商务企业建立呼叫中心。第一个就是客服，有些客...

12-16

苏州电销防封app代理

苏州电销防封app代理电销app：操作简单便捷！手机下载APP就可直接在线拨打！不封号、强大CRM管理系统！也可以通过API接...

12-03

兰州企业外呼系统公司的简单介绍

今天给各位分享兰州企业外呼系统公司的知识，其中也会对进行解释，如果能碰巧解决你现在面临的问题，别忘了关注本站，...

05-17

贵阳不封卡电销卡办理（贵阳办电话卡）

本篇文章给大家谈谈贵阳不封卡电销卡办理，以及贵阳办电话卡对应的知识点，希望对各位有所帮助，不要忘了收藏本站喔。...

05-18

如何在百度地图注册多个店面？如何在百度地图注册多个店面入驻？

如何在百度地图上标注多个地点？地理法：举例来说：的地理位置 1、点内右上角的容第2个图标（如图），确认“收藏点”...

11-27

金华房地产电销软件公司,电话营销线路-价格靠谱

金华房地产电销软件公司,电话营销线路不会受到情绪的影响，流畅的与客户进行沟通，回答专业性的问题，提高成交率。依...

12-17

语音外呼系统平台软件价格（语音营销外呼系统）

本文目录一览： 1、呼叫中心或外呼系统哪种又便宜又好的啊2、外呼系统安装需要哪些费用？3、外呼系统一个多少钱，有哪...

11-27

电信400客服电话是多少电信打400电话要钱吗

400电话是运营商专门为企业设计的呼叫管理中心。它有20多种功能，不仅可以提高企业的通信效率和服务水平，还可以提升企...

01-13

史上最“给力”的机器人——FANUCM-2000iA机器人

在过去的生产模式中，要搬运重量级物品的时候一般都需要输送带或者有类似功能的机器。虽然很多厂家仍然在使用这种机器...

10-30

录音外呼系统怎么删录音（呼呼收音机怎么删除录音）

今天给各位分享录音外呼系统怎么删录音的知识，其中也会对呼呼收音机怎么删除录音进行解释，如果能碰巧解决你现在面临...

11-06

ofo新增用户远超摩拜成行业第一品牌增速连续8个月第一

共享单车在近年来的快速普及，为在城市生活的用户带来了极大的便当，同时也让城市的生活环境变得更加绿色。进入 2017...

10-16

哪里有羿智云外呼系统（智云呼官网）

本文目次一览： 1、成都那家外呼体系对照好， 2、外呼软件有哪些？ 3、电销外呼体系哪个好了？市道上的太多了！有可能推...

11-26

南阳市稳定不封号电销卡便宜

早期，三大运营商各分配了3000万码号资源，空留1704号段无人认领。不过，随着联通合作虚拟运营商飞速发展用户，联通不仅...

02-23

呼叫中心客服系统-企蜂-企蜂云

客户关系管理的实施重在员工的参与，让员工充分的认识到其中的价值尤为重要。要实施新的客户管理模式，还要适应一个相...

10-25

人工客服机器人云呼ai_电话机器人

比人工销售电话机器人更容易使用。电话机器人一天可以打800-1000通电话，不受环境、感情、身体状况等的影响，经常进行稳...

10-31

成都语音外呼系统线路（成都电话外呼系统）

本文目录一览： 1、外呼线路供给(电话发售公用) 2、成都那家外呼体系对照好， 3、外呼线路供给是什么？ 4、外呼体系什么...

11-25

电销卡是什么样的卡号（电销卡是什么卡?谁知道?）

本文目录一览：1、电销卡到底是什么卡呢?2、电销卡和电话卡的区别有哪些?3、电销卡是什么?为什么电销卡也会封号?电销卡...

07-10

石家庄电话机器人如何（大连电话机器人）

本篇文章给大家谈谈石家庄电话机器人如何，以及大连电话机器人对应的知识点，希望对各位有所帮助，不要忘了收藏本站喔...

05-03

周乔亮：政采IT项目如何选择服务外包供应商

在政府采购活动中，与IT有关的采购项目较多，频率也较高。这是因为政府机关、吃财政饭的公共事业机构以及为社会提供公...

10-22

400号怎样申请

申请400号码，需要根据具体需求选择相应的运营商和服务商，按照要求填写相关申请表格，并缴纳相应的费用。下面详细介绍...

07-21

2013十大网络流行用语 2013十大最新网络语言 2013十大最火网络语言

由国家语言资源监测与研究网络媒体中心、商务印书馆、中国网络电视台联合主办的汉语盘点2013近日在京揭晓。经过专家评...

10-19

金华稳定群呼线路办理公司,呼叫中心软件-原创

金华稳定群呼线路办理公司,呼叫中心软件但实际意图客户很少，不是电动推销员能力不好，不是销售员技能不够，但在电话...

12-16

怎么申请一个400的电话（怎样申请400电话号码）

怎么申请一个400的电话（怎样申请400电话号码）近年来，越来越多的企业开始使用400电话，它可以提高客服效率、降低客户...

08-14

南京华翔云语app

南京华翔云语app，办理南京华翔云语app，南京华翔云语app办理云语app 自带黑名单过滤系统呼出不限归属地齐全需要的老板...

11-23

微信公众号代运营公司如何吸粉？有哪些技巧？

微信公众号代运营本身的吸粉的具体办法就有很多，所以这也是威海市呢么会有很多企业和商家挑选公众号代运营的主要原因...

03-01

400电话有哪些智能转接模式

每个企业的400电话都需要绑定多个固话和手机，当用户的拨打咨询时，怎么转接绑定的电话，这就是400电话的智能转接模式。...

05-09

郑州自动外呼系统价钱（智能外呼系统费用）

本文目录一览： 1、外呼体系什么价格？2、外呼体系装置需求哪些费用？3、外呼体系多少钱一个月？4、外呼体系一个多少钱...

04-23

正规物联卡公司排行，谁第一？（物联卡公司排行榜）

随着社会、科技、经济全面发展，物联网发展、物联卡广泛已成为必不可当的趋势。市面上物联卡公司更是层出不穷。究竟哪...

11-07

德阳电话机器人（德阳电话机器人系统）

本文目录一览：1、阿里斯顿太阳能24小时官网电话热线-(全国各网点)24小时400服务热线_百...2、ai问答机器人在线3、315之后,骚...

08-28

解决hive中导入text文件遇到的坑

10-18

本页收集关于解决hive中导入text文件遇到的坑的相关信息资讯供网民参考！

推荐文章

上一篇：详解pygame捕获键盘事件的两种方式

下一篇：python实现高效的遗传算法

一起分享吧