Reddit是“众包相关引擎”

Luis Bitencourt-Emilio在2004年退出了机器学习和正规教育。那时ML的平均准确率高达40%。 他带着学习复仇的方式回来,建立了一个关联引擎 -Reddit用来确定当今与人类到底有什么关联的引擎

我上个月在洛杉矶大数据日听了他的演讲。 他保持稳定的步伐,讲述了与机器一起学习的故事 他最近在Reddit的竞选是谈话的主要内容。 他所学到的东西只有他自己的学习历史才有可能-并命令机器平台做同样的事情。

如果您想更深入—这是2018年大数据日的完整幻灯片和演示文稿
Microsoft回形针的图像结果
资料来源:90年代的软件向导分析师

微软

他们(路易斯和他的机器)对反馈进行了排序。 他们使用情绪分析来确定负面反应,以改进Office等产品。 想想直接反馈而不是可怕的回形针

简单的视觉效果使用户体验清晰可见。 红=坏; 绿色=好

WorkPop,

他们学习了如何对“工作的独特性”进行分类。求职者的大量流动和简历需要机器学习来创建一种对候选人进行排名的新方法。 他们已经知道,按时间顺序排列的旧方法毫无意义。 提早或近期申请与您的身体状况无关。

Reddit

推荐”标签为他们提供了开始数据,以实时查看用户的喜好。 最初,他们使用上下投票来链接用户,然后从全局平均数(平均值)中减去每个人的偏好。

数据稀疏是阻止进一步学习的主要问题。 添加Subreddit时,它们提供了多样性,更多类别和内容标签。

Reddit的工程师得出结论:我们已经构建了一个众包相关引擎

它使用了10TB的训练数据,50M的功能和5M的参数。 引擎必须改进:

  1. 机器学习使引擎个性化 。 让我们添加仪表板和可视化文件,使精炼的数据位于前端和中心,以便我们可以清楚地看到相关性。
  2. 重点:删除默认子reddits,将相似的子redd集群
  3. 使用自然语言处理来确定什么是子编辑,理解并过滤所有的讽刺和不清楚的人类语言。
  4. “ Subreddit代数” =主题可以添加或减去以形成混合子reddit,以推荐

他们创建了Reddit制图师 -图书馆员和数据分析师的混合体。 他们开发了“ Reddit RabbitHole”(Reddit RabbitHole)-一个让您的时间消失在无休止点击中的地方。 他们学习了如何连接帖子,以及如何在用户不属于同一类别或Subreddit的情况下提供帖子间推荐。

机器改变了他们的学习方式。 该体系结构的迭代从搜索文本开始,然后进入处理语言,最后进入带有图像的深度学习。

相关性是一个微妙的主题。 关联引擎使我们可以发现我们可能关心的事情,或者不知道我们关心的事情。 这是一个工具。 当机器进行所有学习并重复相同的假设时,很容易出错。 只需点击几下,Youtube就因其推荐视频的失败和不相关性而广受嘲笑,从儿童卡通到恋物癖视频。

可靠的,可定制的相关性引擎需要您学习。 工程师和像Luis这样的最初的共同学习者开始了这一过程—并创建Rabbit Holes来模仿他们的学习机的长时间上学。

虽然所有这些学习,有什么意义呢? 下次我访问在线R​​eddit大学时,也许会有一门Sub-Subreddit课程。