我想从本周开始,承认如果您是R的新手,那么关于小节的整个部分可能看起来有点抽象 。 如果您阅读了有关小技巧的部分,然后说“那又怎样?”甚至“我迷路了”,那没关系。


因为这些每周汇总旨在帮助R的新手,所以我们将掩盖许多经验丰富的R用户认为应该在此处的信息。 没关系,因为我们的目标是游览整洁的风景,以便您知道主要地标在哪里,而不是在任何一个要素上花费大量时间。
首先听到“ tibble”一词,通常会有以下两种反应之一:




我们非常指的是“ tibble”,这就是tbl_df前半部分的tbl_df 。 您可以在此处阅读更多有关小技巧的信息。
- 好奇心的力量以及探究为何导致成长
- 您自己拥有— YOYO方式以及到目前为止,我只是成为ASPIRING ANDELAN的经历。
- 随时随地学习:5个播客,可用于实际学习
- 对数学的热爱推动了大学挑战赛的明星
- 边教边学
那么,为什么要使用小标题呢? 在R中输入以下代码并逐行运行:
库(tidyverse)iris#注意,当您运行iris时会发生什么 #以这种格式查看数据有多容易/有多困难? as_tibble(iris)#我们用as_tibble()“包装”了虹膜数据集 #将虹膜数据帧转换为小标题 #以这种格式查看数据有多容易/有多困难?
小贴士做了很多非常酷的事情,这些事情最终会使您在R中的生活更轻松,但是我们现在不打算深入探讨这些事情。 取而代之的是,我们要承认存在小动作,小动作很棒,小动作是tidyverse不可或缺的一部分。


到目前为止,我们已经使用的所有数据集都已作为R的一部分存在。尽管这些数据集有助于学习数据科学的基础知识,但您很可能需要分析自己的数据集或其他人给您的数据集。
为此,我们将使用readr包,该包允许我们将数据文件带入RStudio,然后可以在其中使用ggplot2和dplyr类的工具来处理它们。 您可以在此处看到readr可以使用的文件类型列表,但是知道,在本每周readr ,我们将专注于读取.csv文件。


对于这些后续步骤,请随时使用您已有的数据。 如果您没有任何数据并且不想生成某些虚拟数据,则可以下载“按邮政编码分类的人口统计数据.csv文件。
如果您在中有数据。 xls或.xlsx格式(标准Excel工作表),并且不确定如何将其转换为.csv格式,可以按照此处的说明进行操作。
注意:您可以 使用 readxl .xls 和 .xlsx 文件直接 读 入R
有两种解决方法–困难方法和简单方法。 我想鼓励您现在就永远采取简单的方法。
简单的方法
您是否在RStudio中使用过Projects? 没有? 开始吧。
- 打开RStudio
- 转到文件并选择“新建项目”
- 从弹出菜单中选择“新目录”
- 选择“空项目”
- 给您的目录(另一种表示文件夹的名称)命名,例如
test_data - 浏览到计算机上可以轻松找到文件夹的位置,例如桌面
- 点击“在新会话中打开”
- 点击“创建项目”
- 按Cmd / Ctrl + Shift + N在RStudio的左上角创建新的R脚本
好。 如果您一直遵循,那么应该有一个类似于以下内容的设置:


如果您的设置看起来与此不同,请尝试重新执行这些步骤。 如果仍然无法正常工作,请加入Slack组!
既然已经完成了Project的设置,请转到保存数据的位置,然后将.csv文件(或.csv文件本身)的副本移到刚创建的Project文件夹中。
转到RStudio中的R脚本(左上角的大块)并运行以下命令:
library(tidyverse)read_csv(“ name_of_data_file.csv”) #发生了什么?数据<-read_csv(“ name_of_data_file.csv”) 数据 #与上一行代码有何不同?
伸展运动
- 创建其他.csv数据集(或使用已有的数据集),将其放入Project文件夹中,然后将其读入R。
- 在同一项目(Cmd / Ctrl + Shift + N)中创建一个新的R脚本。 不要将任何数据文件读入此脚本。 而是键入
summary(data)。 发生了什么? 这有什么用? 什么时候有用?
艰难的道路
困难的方法包括使用setwd()设置工作目录并从那里开始工作。 我有意对此不做深入探讨,但是如果您想了解更多信息,请联系Slack!
- 查找一个数据集-一个自己的数据集,或一个在线找到的数据集-并将其读入RStudio项目
- 查看数据集的摘要统计信息(EDA的一部分)
- 根据数据集创建少量图形(EDA的一部分)
- 根据您使用此新数据集(EDA的一部分)所学知识,列出您想回答的问题列表
- 参加Slack小组,分享您已学习或创建的内容,或获得上述任何及所有步骤的帮助!


第一周:设置RStudio环境
第二周:数据可视化
第三周:数据转换
第四周:探索性数据分析