
在这些博客中,我将重点介绍我犯的错误以及如何在短时间内成为机器学习/数据科学专家。
学习的乐趣。 AI / ML听起来很性感,但我对此表示怀疑。 在完成了Udacity的自动驾驶汽车入门课程(我很喜欢)之后,我倾向于注册深度学习纳米学位。 那是我的第一个错误。 在花了两周的时间使我的头朝后传播和消失的梯度猛跳后,我意识到我应该从机器学习纳米学位开始。 Udacity非常友好,可以搁置DL,让我继续学习ML。 如果您想以简单但最有效的方式向行业专家学习,我强烈支持ML纳米学位。
每个人都有不同的学习风格。 我喜欢将我的学习与一个真实的项目结合起来,在这里我可以立即运用我的知识。 幸运的是,在Kaggle发起了新的竞赛“房屋违约信用风险”。 (后来我意识到这是我做过的最明智的举动)。
现在我处于困境。 我拥有ML纳米学位,Kaggle竞赛和实际工作(需要付账),大约需要2-3个月才能完成。
有趣的开始了! 我立即意识到,除非我了解Python,否则我不会去任何地方。 这些年来,我在编程和C ++方面拥有丰富的经验,因此很快就可以参考python语法并开始使用。 毕竟它是一种脚本语言! 没有指针,没有内存故障,没有乐趣。 对于那些不是计算机工程背景的人,我建议您在ML之前学习python课程。 Udacity提供了有关Python的免费课程。 但是,如果您用谷歌搜索,它还有更多。
学到新东西就是要克服但不会放弃的障碍。 经历之后,您将获得满意! Udacity课程开始谈论混淆矩阵,准确性和精度,只是让我意识到我需要刷新统计信息。 我的同事在edx平台上从Microsoft找到了有趣的课程。 “机器学习的基本数学”。 如果您有科学背景,则可能只需要一天或最多2天就可以完成。但这将为您提供前进的必要信心。
最后,我向房间里的大象讲话。 我研究了监督学习中的线性回归,决策树,朴素贝叶斯,支持向量机。 我还研究了无监督学习中的聚类,PCA。 到这个时候,我对很多事情已经足够了解了,但是不知道在现实生活中什么会起作用。 Kaggle的压力越来越大。 许多人的分数都很高。 现在是时候攻击Kaggle了。
我相信Kaggle是个福音。 数据科学中最大的障碍之一就是数据! 由于隐私问题,收集可靠的,标准化的数据非常耗时,乏味并且通常受到严格保护。 但是Kaggle的竞争来自现成的数据和问题陈述。 因此,您可以运用自己的知识和实践。 Kaggle还在一个论坛上带来了最聪明的数据科学家头脑,这为您提供了必要的帮助,并感觉您属于社区。 Kaggle还提供Jupyter笔记本电脑,因此您无需在计算机上执行任何安装。 但是,我更喜欢本地的所有内容,因此我使用python3和许多库以及Jupyter Notebook和Anaconda来设置机器以维护环境。
下一部分将提供更多的技术/代码,因为我将详细了解如何在不到一个月的时间内从队列中的最后一个人开始成为排名前10%的贡献者之一(在7198个参与团队中排名666)。 是的,我没有获胜,但是学习是无价的。 敬请关注!