想要:一种新的评估模型

如果以项目为基础的学习成为美国学校课程的核心,那么我们大规模标准化测试的问题将比现在更加突出。 当然,这不是放弃基于项目的学习的原因; 相反,这是找到更好的测试方法的原因。

尽管我们目前可能会对它们进行许多不满,但我们确实需要并且将继续需要进行大规模评估。 本地评估本身并不能告诉我们我们需要了解的州或国家级学生表现。 如果没有大规模评估,我们将看不到亚组和地区之间的差异,因此无法就谁需要更多帮助,在哪里最好地投入资源,哪些工作有效,什么情况没有做出充分知情的决定。

大规模评估的许多基本目标值得称赞:公平,改进,良好的管理。 而是它们形式的局限性使测试变得如此成问题。 他们受到严格限制,无法开展和衡量各种学术工作。 因此,在一定程度上,他们要求课堂集中注意力或指导教学,因此他们积极地劝阻真正的学术工作,而这是基于项目的学习的目的。

之所以如此,是因为效率和可伸缩性(而不是真实性)决定了它们的形式。 测试由人工任务(主要是多项选择题)组成,以便可以快速,廉价地记录和评估学生的表现。 它们是在高度人为的条件下进行管理的,因为任务的人为性会造成特殊的安全性和可靠性问题,这些问题只有通过进一步将人为性与严格的时间限制,集中的测试位置以及快照性能隔离在一起才能解决。所有现实世界中的辅助工具和资源,包括彼此之间。

由于格式方面的限制,常规的标准化测试根本无法为学生提供机会来证明构成真实知识工作的技能:例如,产生想法,计划,协作,试验和修改,对最终产品进行吐唾沫。

测试无法激发出这些技能,因为在他们现有的化身中,他们无法容纳完成工作所需的时间,并且因为大规模评估此类学生工作的成本将从一开始就注定了整个企业。

换句话说,以项目为基础的学习为目标的真正的学术工作无法通过常规的大规模标准化测试来捕捉 。

如果PBL成为课程的核心,那么现有的测试范式将完全无法生成首先证明测试合理的学生成绩信息。

当然,有人可能会争辩说,标准化测试永远都不能声称只是间接测量。 它们是用来表示更多技能的代理,而不是详尽评估学生所知道和可以做的一切。 测量的局部性和间接性正是我们对时间和成本约束的让步。 无论如何,有些信息总比没有好。 评估只需要足够好就可以对内容域进行抽样,并表明孩子们是否掌握基本技能。

如果是这样,那么测试的理由就归结为基本技能是否足以代替PBL置于教育中心的高阶技能。 我们可以根据我们实际讲授的有限内容做出资金和问责制决策吗? 还是在某一点上,考试可以衡量的内容与我们认为学生需要知道的内容之间的差距变得如此之大,以至于使代理论点变得完全难以置信?

标准化测试的问题在于其形式,不一定是其功能。 从根本上讲,这是一个技术问题。 多项选择问题是20世纪的一项技术,它使规模经济成为可能,这种经济已经推动了近一个世纪的标准化测试格式。

当今的测试仍然主要依靠多项选择题,即使它们从纸质迁移到计算机也是如此。 基于计算机的测试中出现的新的“技术增强型”项目类型仍然是多选格式的精心设计形式。 他们仍然未能从学生那里获得真正的学术工作核心的技能和能力。 这些测试一直植根于20世纪中叶的技术中,即使围绕它们出现了非常强大的联网数字技术。

如今,我们可以使用现有技术来捕捉学生在参与扩展的学术项目(从计划到完成)时展示的所有技能和能力。 我们可以促进和记录工作组内部的协作互动,无论是局限在单个教室中,还是来自全国或世界各地的团队。 我们甚至可以生成有关个人品质的可评估信息,例如持久性和韧性,捕捉学生在生成解决方案中所付出的努力,例如,根据反馈来修改他们的工作,或者为他人提供想法和帮助。

现有的技术可以激发和捕获通过基于项目的学习所培养出的关键技能,包括认知和非认知技能。 凭借在评估模式上的一些创造力,并愿意重新考虑采用隐蔽方法来测试信度和效度,我们可以替换与我们最雄心勃勃的教育目标背道而驰的测试模型。

为了使有一天要在项目中占主导地位的基于项目的学习,我们将需要一种大规模评估形式,以验证其有效性和跨群体和区域性的公平性。 该评估将需要嵌入教学和学习活动中,这是学习本身的一个不可或缺的方面,而不是干扰或侵入真实,具有挑战性和令人满意的实践,尝试,制作,做,建设和创造的经验。 这将是一项真实的评估,能够囊括成功完成实际学术工作所需的全部知识和技能。