申请专栏作者
您的当前位置:主页 > 数据挖掘 > 正文

使用R进行数据匹配的方法

来源: 时间:2018-10-10
请点击下面的广告后浏览!

R中的merge函数类似于Excel中的Vlookup,可以实现对两个数据表进行匹配和拼接的功能。与Excel不同之处在于merge函数有4种匹配拼接模式,分别为inner,left,right和outer模式。 其中inner为默认的匹配模式。本篇文章我们将介绍merge函数的使用方法和4种拼接模式的区别。

可思数据-AI,智能驾驶,人脸识别,区块链,大数据

nov2014-f2-urgetomerge 本文来自可思数据,转载请联系本站及注明出处

  可思数据-www.sykv.cn,sykv.com

函数功能介绍

可思数据

merge函数的使用方法很简单,以下是官方的函数功能介绍和使用说明。merge函数中第一个出现的数据表是拼接后的left部分,第二个出现的数据表是拼接后的right部分。merge默认会按照两个数据表中共有的字段名称进行匹配和拼接。 可思数据-数据挖掘,智慧医疗,机器视觉,机器人

#查看merge帮助信息 可思数据

?merge

可思数据-数据挖掘,智慧医疗,机器视觉,机器人

  可思数据-www.sykv.cn,sykv.com

merge-two-data-frames

  可思数据-AI,智能驾驶,人脸识别,区块链,大数据

读取并创建数据表 可思数据-数据挖掘,智慧医疗,机器视觉,机器人

开始使用merge函数进行数据拼接之前先读取需要进行匹配的两个数据表,并命名为loan_status表和member_info表。

可思数据-AI,人工智能,深度学习,机器学习,神经网络

#读取并创建贷款状态数据表 可思数据-www.sykv.cn,sykv.com

loan_status=data.frame(read.csv('loan_status.csv',header = 1))

可思数据-人工智能资讯平台

#读取并创建用户信息数据表

可思数据

member_info=data.frame(read.csv('member_info.csv',header = 1)) 可思数据-www.sykv.cn,sykv.com

查看数据表

可思数据

下面我们分别查看了两个数据表中的内容。这个示例中的两个数据表较小,可以完整显示出来,如果数据量较大的话可以就不能这么直观的查看了。

本文来自可思数据,转载请联系本站及注明出处

#查看贷款状态数据表 可思数据-AI,人工智能,深度学习,机器学习,神经网络

loan_status

可思数据

 

可思数据

%e8%b4%b7%e6%ac%be%e7%8a%b6%e6%80%81%e8%a1%a8

  可思数据-AI,人工智能,深度学习,机器学习,神经网络

#查看用户信息数据表

可思数据-人工智能资讯平台

member_info

可思数据-数据挖掘,智慧医疗,机器视觉,机器人

 

可思数据-AI,智能驾驶,人脸识别,区块链,大数据

%e7%94%a8%e6%88%b7%e4%bf%a1%e6%81%af%e8%a1%a8

 

可思数据-AI,智能驾驶,人脸识别,区块链,大数据

对于较大的数据表,可以使用dim函数查看数据表的维度,下面我们分别查看了贷款状态表和用户信息表的维度。贷款状态表有27行7列,用户信息表有25行4列。 可思数据

#查看两个数据表的维度 可思数据-www.sykv.cn,sykv.com

dim(loan_status);dim(member_info) 可思数据

[1] 27 7

可思数据-AI,人工智能,深度学习,机器学习,神经网络

[1] 25 4

可思数据

使用names函数查看两个数据表的列名称,下面分别显示了代码和列名称。可以发现,两个数据表中有一个共同的列member_id。 本文来自可思数据,转载请联系本站及注明出处

#查看两个数据表的列名称 可思数据-人工智能资讯平台

names(loan_status);names(member_info)

内容来自可思数据

[1] "member_id" "loan_amnt" "term""issue_d" "loan_status" "total_pymnt_inv" "total_rec_int"

内容来自可思数据

[1] "member_id" "grade" "emp_length" "annual_inc" 可思数据-AI,人工智能,深度学习,机器学习,神经网络

inner匹配

可思数据-www.sykv.cn,sykv.com

inner模式是merge的默认匹配模式,我们通过下面的文氏图来说明inner的匹配方法。Inner模式提供在loan_status和member_info表中共有字段的匹配结果。也就是对两个的表交集部分进行匹配和拼接。单独只出现在一个表中的字段值不会参与匹配和拼接。从下面的匹配结果中也可以看出,共有22行,包含了loan_status和member_info的交集。 可思数据-人工智能资讯平台

 

可思数据-AI,人工智能,深度学习,机器学习,神经网络

inner_img

 

可思数据

#inner模式匹配 可思数据-www.sykv.cn,sykv.com

merge(loan_status,member_info,by = 'member_id')

可思数据-AI,人工智能,深度学习,机器学习,神经网络

  内容来自可思数据

inner%e5%8c%b9%e9%85%8d

 

内容来自可思数据

outer匹配 内容来自可思数据

outer模式是两个表的汇总,将loan_status和member_info两个要匹配的两个表汇总在一起,生成一张汇总的唯一值数据表以及匹配结果。从结果中可以看出共包含30行数据,比两个表的行数都要多。并且在grade和其他字段包含Na值,这些是在两个表中匹配不到的内容。 可思数据-AI,人工智能,深度学习,机器学习,神经网络

  可思数据

outer_img

  内容来自可思数据

#outer模式匹配

可思数据-人工智能资讯平台

merge(loan_status,member_info,all=TRUE,sort=TRUE) 可思数据-AI,人工智能,深度学习,机器学习,神经网络

  可思数据-AI,智能驾驶,人脸识别,区块链,大数据

outer%e5%8c%b9%e9%85%8d

 

可思数据-www.sykv.cn,sykv.com

left匹配

可思数据-www.sykv.cn,sykv.com

left模式是左匹配,以左边的数据表loan_status为基础匹配右边的数据表member_info中的内容。匹配不到的内容以NaN值显示。在Excel中就好像将Vlookup公式写在了左边的表中。下面的文氏图说明了left模式的匹配方法。Left模式匹配的结果显示了所有左边数据表的内容,以及和右边数据表共有的内容。

本文来自可思数据,转载请联系本站及注明出处

  可思数据-www.sykv.cn,sykv.com

left_img

 

可思数据-人工智能资讯平台

以下为使用left模式匹配并拼接后的结果,loan_status在merge函数中第一个出现,因此为左表,member_grade第二个出现,为右表。匹配模式为all.x=TRUE。从结果中可以看出left匹配模式保留了一张完整的loan_status表,以此为基础对member_info表中的内容进行匹配。loan_status表中有5个member_id值在member_info中无法找到,因此grade字段显示为NA值。 可思数据-人工智能资讯平台

#left模式匹配

可思数据-AI,智能驾驶,人脸识别,区块链,大数据

merge(loan_status,member_info,all.x=TRUE,sort=TRUE) 可思数据

  可思数据-AI,人工智能,深度学习,机器学习,神经网络

left%e5%8c%b9%e9%85%8d

 

内容来自可思数据

right匹配 内容来自可思数据

right与left模式正好相反,right模式是右匹配,以右边的数据表member_info为基础匹配左边的数据表loan_status。匹配不到的内容以NA值显示。下面通过文氏图说明right模式的匹配方法。Right模式匹配的结果显示了所有右边数据表的内容,以及和左边数据表共有的内容。 可思数据-AI,智能驾驶,人脸识别,区块链,大数据

 

可思数据-人工智能资讯平台

right_img

 

可思数据

以下为使用right模式匹配拼接的结果,从结果表中可以看出right匹配模式保留了完整的member_info表,以此为基础对loan_status表进行匹配,在loan_status数据表中有3个条目在member_info数据表中无法找到,因此显示为了NA值。 可思数据-AI,智能驾驶,人脸识别,区块链,大数据

#right模式匹配

可思数据-数据挖掘,智慧医疗,机器视觉,机器人

merge(loan_status,member_info,all.y=TRUE,sort=TRUE)

内容来自可思数据

 

可思数据-www.sykv.cn,sykv.com

right%e5%8c%b9%e9%85%8d

网友评论:

发表评论
请自觉遵守互联网相关的政策法规,严禁发布色情、暴力、反动的言论。
评价:
表情:
用户名: 验证码:点击我更换图片

Copyright©2005-2019 Sykv.com 可思数据 版权所有    网站地图   联系我们  

人工智能资讯   人工智能资讯   人工智能资讯   人工智能资讯

扫码入群
咨询反馈
扫码关注

微信公众号

返回顶部