如何教汉学数字方法

数字方法革新了许多研究领域,不仅提供了更有效的沿传统方式进行研究和教学的方法,而且还提出了全新的方向和研究问题,这些问题在数字化之前是不切实际甚至是不可能的。年龄。

这场数字革命为包括中国研究在内的许多人文学科提供了新的令人兴奋的机会。 通过使用计算机软件,数字技术使大规模研究材料成为可能,由于组装和处理原始材料需要时间和人工,因此深入研究曾经是完全不切实际的。 更令人兴奋的是,它们为应用复杂的统计技术(由于科学和工业的应用而在其他领域已经广泛开发)提供了机会,以对重要的人文问题提供新的见解和理解。

墨子,X子和庄子之间的文字关系(图片:C-Text项目)

在此背景下,2016年,作为费尔班克斯中心“数字中国计划”的一部分,并在东亚语言与文化部的支持下,首次向哈佛社区开设了名为“ 中国研究数字方法 ”的研究生课程。 。

本课程旨在向主要从事汉语研究的学生介绍实用的编程技能和数字人文技术,以便将来将其应用于自己的研究中。 尽管没有编程或数字技术方面的技术背景,但在整个学期中,学生获得了用于分析和可视化文本资料的现代软件技术的动手经验。 首先是对使用Python进行编程的实用介绍,它是其余部分的基础,它为学生提供了创建软件“胶水”的实践经验,这些胶水通常是将不同技术和实际数据源绑定在一起所必需的,使用数字方法进行有意义的研究。

虽然不是编程课程,因此没有尝试全面涵盖整个编程语言,但是编程元素对于使学生能够独立地使用数字技术开展有用的研究这一总体目标至关重要,这既是课程的一部分,也是其未来工作的一部分。 通过允许学生学习如何将大量数据从当前可用的任何形式(例如网页,学术数据库以及其他各种主要源数据集合)转换为可以应用有用的分析的形式,该课程的编程部分也使每个学生都可以直接使用与他或她自己的研究相关的材料,而不是简单地使用教师选择的示例。

[数字人文科学]提供了应用复杂的统计技术的机会,以使人们对重要的人文问题提出新的见解和理解。

在介绍基本程序设计的同时,本课程还涵盖了范围广泛的数字方法,重点是适用于文本材料研究的方法。 这些始于简单但高度灵活的技术,例如正则表达式,一种用于指定和识别文本数据中的模式的标准机制,以及一种特别适合汉语的材料,因为后者具有很高的每个字符的语义内容。 然后,本课程转向更专业和更先进的技术,从从网站和在线存储库自动收集大量数据的实用方法开始,这是学生获取研究项目所需数据的方式之一。 涵盖的其他主题包括自动识别文本相似性和文本重用,关系数据的网络可视化,使用主题建模的远程阅读,最后是主成分分析和机器学习。

鉴于课程的内容和目标的性质,该格式具有高度的交互性,所涵盖的每个主题均通过实际示例进行介绍,并由课堂上的所有学生应用于适当的数据。 每周的课程通常以介绍新概念和对技术本身的概述开始,然后是动手实验课程,在该课程中,学生使用实际数据在实践中应用这些技术。 课程的最后部分完全由学生介绍组成,其中每个学生根据在课程中涉及的技术对他们自己的研究材料的应用介绍了自己的数据,方法,结果和分析。 有很多精彩的演讲,涉及各种各样的主题。 为了说明学生在一个学期中的学习成绩,以下是从2017年春季课程的两个学生项目中摘录的具体示例。

数字方法课程的学生项目

1.中国优秀学者和美女的故事

朱文初的这个项目侧重于传统上被归类为“才子佳人小说”的前现代小说体裁。 应用程序编程接口(API)首先从中文文本项目数据库中使用Python获取了为该项目选择的22个标题的全文。 故意选择的文本包括几本著作的作者和日期不详或有争议的作品,并且该项目的目标之一是根据这些文本的内容和风格与以下内容的比较来识别和解释这些文本作者的可能证据。研究中包括的其他文章。

Wenchu在她的项目中应用了多种技术,包括使用相似性度量方法来比较文本中词汇使用的变化情况,并使用支持向量机(SVM,一种机器学习算法)来训练统计模型,以准确地区分所写文本根据对内容的分析,以各种不同的样式进行评估,并评估其在已知情况下的可靠性。 然后,她使用支持向量机(SVM)应用了类似的技术来建立统计模型,旨在根据单词的使用情况来区分在不同时期创作的小说。 使用已知作者的文本数据对该模型进行了训练和评估,以证明其结果的可靠性,然后将该模型应用于具有可疑作者的文本,以预测其可能的来历。

她的项目还使用主成分分析(PCA)来研究研究文本之间的风格变化。 PCA可以与文本材料一起使用,以可视化单词频率在不同作品中的变化情况。 为了研究文体变化,文初只关注语法词(虚词)的频率,因为与内容术语(实词)的频率不同,这些词可能会在特定的写作风格中保持一致,即使主题发生变化。 将PCA应用于从研究中每个文本的每一章提取的频率数据,以二维可视化显示文本内部和文本之间的语法颗粒用法:

在上图中,每个点代表一个文本的一部分,该部分所属的文本由图例中指示的颜色表示。 看起来更靠近的点对应于总体上语法颗粒的使用率相似的章节,而相距较远的章节具有较大的变化程度。 红线是解释性注释,突出了娇红记,西厢记和牡丹亭(分别由深蓝色,绿色和浅蓝色表示)与其余文本之间样式上的明显差异。

然后出于不同的目的重新应用了相同的技术:研究这些文本之间的内容差异而不是样式差异。 在这种情况下,分析的频率不是粒子的频率,而是与道德或价值判断相关的词,例如礼节,义,道,善,恶等。这导致可视化效果对应于这些用法的变化所考虑的文本中的术语:

红线再次由Wenchu解释性地添加,指示在这组文本中,所选用语的用法在频率模式仅出现在左侧的文本和仅出现在右侧出现的文本之间的区别是多么明显—少数值得注意的例外值得人工调查。

2.当代中国的政治改革

李加鲁的这个项目着眼于更多的近期资源,通过分析从中国改革信息库(reformdata.org)的行政体制综合部分获得的1977年至2016年的305份中央政府报告,调查了当代中国的政治精英及其改革议程。 )网站。 这些是使用Python程序自动获取的,这意味着无需大量的人工就可以获取大量数据。 贾鲁还计划在将来使用更大的数据集进一步开发该项目。

然后,Jialu使用主题建模来促进远距离阅读获得的文档。 主题建模是一种统计技术,可通过自动分析整个文档集中的词频和共现模式,来对大量文本材料进行解释性洞察。 主题建模产生“主题”列表-在主题建模的上下文中,“主题”是一组单词-以及对于每个文档,说明这些“主题”中的哪个与文档相关联。 现实世界中的自然语言文档在讨论某些主题时倾向于使用某些单词,因此这些单词也往往在不同的文档中反复出现。例如,讨论中国的报纸文章更可能包含“北京”,“ “中国共产党”或“亚洲”比与中国无关的典型文件要好,尽管这些词可能出现在一些不相关的文件中。 结果,在给定足够多的文档的情况下,有可能在统计上识别出经常在同一类型的文档中同时出现的单词组,并同时识别出这些单词组中的哪一组(以及显示的程度如何) )中的任何给定文档。 所生成的“主题”是出于统计目的的,因此无法保证其在构成其主题的统计属性之外仍然有意义。 但是,结合人类的解释,它们可以通过分析可见的模式来分析大型文本材料中的趋势,而这些模式在不费周折地逐文档仔细阅读的情况下是看不到的。

在贾鲁的项目中,首先从获得的文档集中创建主题模型,然后确定有意义的主题并赋予解释性标签,例如“改革试点与简政放权(试点改革和权力下放)”或“对国务院进行依法监督(国务院的法律监督)”,描述了这些协会所代表的“话题”倾向于讨论哪些政治主题。 然后,将对主题的这种解释与主题模型本身的数据一起使用,这些数据涉及主题与文档之间的关系,以及有关在哪些年份生成哪些文档的数据,以绘制主题随时间的变化,例如如下图:

以1989年左右为中心的蓝峰表明,在这段时期内,行政改革在所研究的文件中成为中心主题,并在1990年代初急剧下降。 以2007年为中心的红色峰越宽越平坦,对国务院法律监督的关注就更加谨慎(但寿命更长)。 产生的主题模型还使得可以在大量文档中快速识别任何一年中哪些特定文档与任何给定主题密切相关,因此上述图表不仅提供了以下内容的概览:不仅可以汇总数据,还可以汇总地图,以便在特定的时间点查找与特定主题相关的文档。