进入差距:机器学习揭示了性别和写作

克里斯汀·门格·安德森 改自flickr / David Orban 我们用于从自动回复文章生成文本的技术正在学习我们提供给他们的文本集中的模式。 在我的Wikipedia页面的底部是一个标签,标识我为“美国女小说家”。如果我是男人,该标签将显示为“美国男小说家”。我的性别与我的职业无关,但在那里,与我的职业紧密相连,就好像我和男性小说家在本质上是不同的领域中工作一样。 但是,我们很容易做出愤世嫉俗的论点。 研究表明,女性书籍的价格低于男性书籍,对女性小说的评论较少,在文学期刊上的出版频率也较低。 甚至关于女性的书比关于男性的书更不可能获得奖赏。 男性和女性所经历的领域确实是不同的:其中之一存在更多的粗糙斑点和坑洼。 在过去的几个月中,当我研究大型文本语料库时,我经常发现自己在思考写作世界中的性别不平等。 我想为一个机器学习项目收集男女被禁止的书籍(我计划在不同的语料库上训练两个生成文本的模型,并将它们放在对话中),但是尽管男性被禁止的文本在公众中还是很容易找到的事实证明,女性禁止使用的文本要困难得多。 当我在古腾堡计划中搜索被禁止的文本时,该计划中有58,000多个文本可以免费下载,我开始怀疑有多少本书(无论是否被禁止)是女性使用的。 一种估计来自Wikidata,其中在Wikipedia页面上找到的信息(例如人的姓名,性别或职业)以机器可读的方式存储。 我发现大约有一万二千人(作家,编辑,插图画家,翻译者)为该语料库做出了贡献。 在这一子集中,男人比女人多5到1。尽管性别不是二元的,但我看一下男人和女人的数量,因为这是使用基于名称的性别预测工具可获得的或可估计的信息。 我来古腾堡计划(Project…