机器学习理论与实践的平衡

理论和实践是数据职业的互补方面,尤其是机器学习的从业人员。 人们通常会根据自己的自然兴趣和学习方式而掉入理论实践围栏的一侧。 但是要在这个领域变得出色,就需要您积极地在我们阅读的概念和我们面临的现实场景之间取得平衡。 那么如何平衡呢? 建立您所阅读的内容! 您需要构建东西; 很多事情。 您需要构建一个神经网络,并查看其如何像文档或日记一样执行任何操作。 您需要尝试Kaggle比赛,看看自己尴尬的低排名盯着您。 您需要一起破解一个javascript应用程序,该应用程序试图在后端运行ML算法,只是由于未知原因而停止运行。 许多人因为不舒服而回避建筑。 不断地跟踪错误,无休止地遍历堆栈溢出,试图将如此多的交互部件整合到一个系统中。 另一方面,阅读很有趣且容易,因为材料像一个完美的小故事一样流动。 所有概念都已经摆放到位,我们正在使用的叙述是我们所有人都希望事情能够成功的方式。 但是,如果您不感到不适,就不会学习。 理论上和实践上当然都是这样,但我认为阅读起来容易些。 当我们翻阅期刊并理解概念时,我们会感到很好,但仅阅读其他方面的成就,您就不会在自己的领域有所作为。 如果您建立了自己的阅读内容,并且失败了(并且将会失败),您将获得无法通过阅读吸收的理解。…

实现您的数字梦想的最佳途径-思考和行动无缝

一个真正的数字工作场所必须能够无缝,智能,灵活和安全地工作并带来根本的改善。 它应该重新定义处理方式,减少流程的周期时间,管理环境知识并提高利益相关者的参与度和满意度。 概念的演变 电子邮件,内部网和群件是数字工作场所概念的早期祖先,但它仅在过去十年才真正发展。 随着当今的组织了解数字化转型的意义和原因,该术语作为一个整体已变得越来越独特。 按照Google的趋势,人们对“数字工作场所”一词的兴趣在2004年达到顶峰,然后下降,直到2013年才开始下降,此后一直在不断增长。 早在2011年,Digital Workplace Group就推出了数字工作场所的“同心蛋图”。 根据Gartner的说法, 54%的公司部分或完全没有参与数字化工作场所。 46%的公司拥有特定的数字工作场所项目,并且 只有4%的人拥有领导者,而他实际上是在拥有所有权。 问题的症结 在过去的二十年中,我们已经看到各种信息管理技术进入工作场所。 它们都带来了改进,但是仅仅是渐进的,它们都具有一些基本缺点,这些缺点阻碍了生产率的大幅提高: 它们主要以孤岛的形式存在,这导致企业信息模型破裂,具有大量冗余且没有单一的事实版本。 他们要么管理非结构化信息,要么管理结构化数据,无法扩展到大数据和机器学习需求。…

在数据中寻找摇钱树客户

这是我30天写作挑战赛的第五天 。 在接下来的几周中,我将执行一项任务,以尽可能多地学习机器学习。 我将在本月晚些时候开始一份新工作,在那里我将建立一个机器学习团队,所以我想开始一个良好的开端。 到目前为止,我们主要集中在有监督的学习上。 也就是说,需要我们通过输入数据并告诉结果结果来训练模型的算法。 我们探索了tf-idf来查找文档中的重要单词,然后使用贝叶斯分类基于文档中包含的单词对文档进行分类。 昨天,我们在尝试将机器学习应用于不需要的问题时遇到了麻烦。 今天,让我们看看无监督学习。 即,在原始数据中找到模式和相关性的算法。 我想改变方向,远离寻找文本的见解。 想象我们经营一个移动网络,我们所有的客户每月都支付打个电话的费用。 可以肯定地说,我们的某些客户将比其他客户更有价值。 有些客户每个月都会使用他们的全部通话时间,而有些客户只会偶尔使用他们的电话。 我们希望将每个客户分配给三个组之一。 我们的摇钱树(花很多钱但不消耗很多资源的人),我们的狗(花很少钱但是却消耗很多资源的人)以及介于两者之间的那些人。 我们可以为支付最多但使用分钟数最少的客户提供折扣。 我们可以为支付最少但使用最多时间的客户提供不同的计划。…

作家的内容复杂性度量变得更聪明了

我们最近推出了对平台的新更新。 您可能甚至没有注意到-但仔细一看,您会立即看到它。 该更新解决了各种问题,但主要集中在我们对“ 内容复杂性”指标的全面改革上。 内容复杂度根据您希望编写的受众知识水平为您提供同义词。 例如:如果您主要是在非常技术性的领域为行业专业人士撰写文章,则可以理解您的文章包含行话和行业特定术语。 相反,将为行业新手或希望了解更多信息的人撰写为更广泛的读者而撰写的文章。 在这里,您可能不想使用太多的术语或技术术语,因为它们可能会影响读者的头脑。 此外,为行业专业人士撰写非常基本的文章可能意味着读者缺乏信誉。 他们可能会与您的帖子脱离接触,并在其他地方寻找针对其知识水平的信息。 这就是我们的内容复杂性度量的来源 。 它会找出与您所需的受众水平不符的单词,然后为您提供更合适的同义词。 它就像一个智能同义词库,并能够为您提供更简单或更复杂的同义词。 几个客户多次提到我们的内容复杂性衡量标准有些偏离。 单词替换的建议非常有限-提出的建议往往与上下文无关,不适用于该短语的上下文。 建议的替换词与所需的可读性不匹配-当您尝试改善文章的“原子分数”时,错过了分数。 此更新旨在解决这些问题-它涉及调整当前的机制并添加新的机制,以提供更好的整体用户体验。…