教学质量评估到底评什么?我扒了87位老师的评教原始数据,标准差只有1.8

🔑 关键词:教学质量评估,学生评教,教务系统评教,督导听课,教学质量评价指标

📖 摘要:在教务处干过三年的人,扒了一个学院87位任课教师整整一学期的评教原始数据:平均分94.3,标准差只有1.8。评教分数在通货膨胀,最后被拿来用的却是统计学上最没意义的那个指标——末位。附被评的老师该怎么应对、填表的学生该注意什么。

先说一个我到现在都记得的数字

图片

我第一次认真看教学质量评估的原始数据,是在教学楼B座三楼那间没有窗户的办公室。空调外机嗡嗡地响,像有人拿指甲慢慢刮铁皮。我盯着教务系统导出来的一个四千多行的 Excel,脖子后面那根筋一跳一跳的。

那是一个学期、一个学院、87 位任课教师的全部学生评教记录。

学生评教的平均分是 94.3。最高 99.2,最低 88.6。标准差 1.8。

我盯着这个标准差看了很久。1.8 是什么概念呢?就是这 87 个人,在学生眼里几乎是一个人。你讲得口干舌燥、粉笔灰呛到嗓子眼,和你照着 PPT 念四十五分钟,最后的差距是 1.8 分。

那次之后我就不太信「教学质量评估」这四个字了。但我还是在这行干了好几年。

那套表到底是怎么算出来的

现在大部分高校用的教学质量评估,核心就一句话:把几个来源的主观打分,按权重加权平均。

我待过的两所学校,权重结构大差不差:

图片

评价来源 常见权重 谁在打
学生评教 30%–50% 上课的学生,期末在教务系统填
督导听课 15%–30% 退休返聘或兼职的教学督导
同行评议 10%–15% 同教研室老师互评
院系领导评价 10%–20% 院长、教学副院长、系主任
教学材料检查 10%–15% 教案、试卷、作业批改、成绩分析

量表一般是李克特 5 级(非常满意 / 满意 / 一般 / 不满意 / 非常不满意),或者直接百分制。学生端还会有一道开放题,通常是「你最想对这位老师说的一句话」。

评教窗口一般开在每学期第 15–17 周,也就是期末考试前,开放 7–14 天。很多学校的规定是:不完成评教,查不了成绩,也选不了下学期的课。所以回收率通常能到 85% 以上——这一点上,教务系统的产品经理比谁都懂怎么让人填表。

问题在哪儿呢。

每一栏都能「做」

我不装客观。

学生评教:老师在最后一节课前会说一句「同学们记得去评教啊,老师这学期也不容易」。这里面的暗示强到什么程度?强到有一年,某个班四十多个人的主观题答案里,有 9 个人写了「老师您辛苦了」。

督导听课:提前一周打招呼,把期中考试挪后,讲最熟的那一节。督导坐在倒数第二排靠门,听 45 分钟,打个分,签个字,走了。

教学材料:期末那两周,我见过有老师在办公室补教案补到凌晨,日期是从后往前填的。我给他递过一杯咖啡,他头都没抬。

图片

同行评议:教研室十个人,你打我一个 95,我打你一个 95,皆大欢喜。

所以,一套看起来有五个维度、二十个观测点、加权重算到小数点后两位的评价体系,最后的实际区分度,就是那个 1.8。

一个我很不想承认的观点

教学质量评估,现在最大的功能已经不是测量教学质量了。

它是管理留痕,是一份免责凭证。

学校要向上证明「我们有质量保障体系」,就得有数据;评估要用数据说话,就得有量表;有了量表,就得有人填。整条链子上,唯一被落下的是「教学质量」本身——因为它没法被切成二十个观测点,每个观测点打五分。

而且还有一层,是我看了两三年数据才慢慢看明白的:

评教分数是一种货币,而且是会通货膨胀的货币。

图片

每个老师都在「做多」自己的分数,因为分数低要写整改报告、要被约谈、要影响职称。当所有人都把分数往上推的时候,绝对数值就没有意义了。这时候管理者怎么办?

有一个统计学上几乎没有意义的指标,在现实中非常有用。它叫「末位」。

某个学院规定,评教排名后 10% 的老师,当年不得申报职称,需要提交《教学质量整改报告》。1.8 分的标准差里,最后那 8 个人,可能只是那天讲得有点闷,可能只是某门课本身难、学生挂科多、心里有气。

这件事,比「评不准」更让人难受。

顺带说一句,这套东西往上还有更大的背景。2020 年 10 月中共中央、国务院印发的《深化新时代教育评价改革总体方案》,2021 年 2 月教育部印发的《普通高等学校本科教育教学审核评估实施方案(2021—2025 年)》,都在讲「破五唯」、讲改进结果评价。文件写得挺好,落到某栋楼三楼那个 Excel 里,就变成了我自己也解释不清的一列数字。

如果你是被评的老师

说点实操的,别全是牢骚。

第一,把及格线以上的力气省下来。既然 88 分和 99 分在体系里的功能是一样的(都不触发整改),那你就别为了那 3 分去讨好。真正会出事的是低于学院平均分两个标准差,或者掉进后 10%。先搞清楚你们学校的具体线在哪,问教务处或者教学秘书,这个数据不保密。

图片

第二,唯一有信息量的是那几道主观题。分数别看,去看开放题。学生说不出「教学逻辑不清」这种词,但他们会写「老师你能不能别一直念 PPT」「第三节课我好困」。这才是你真正的评估报告。

第三,第一次课和最后一次课的权重被严重低估。第一节课决定学生给你贴什么标签,最后一节课决定他们评教时的手感。不是让你表演,是让你在第一节课把「这门课我会考什么、你不用背什么、这学期你大概能学到什么」讲清楚。这比讲十分钟课程意义有用得多。

第四,别跟教学事故混为一谈。迟到 5 分钟算不算、监考看手机算不算,那是另一套文件在管,跟评教分数是两条线。很多人被吓唬住,是因为把这两件事搅在一起了。

还有第五点,有点阴暗但真实:期末评教之前那节课,认真上一次。学生的手感是有近因效应的,你前面十四周讲得再好,最后一节课划水,他们记住的就是划水那节。

如果你是填表的学生

也说两句。

系统说匿名,大体上是真的——教师端一般只能看到聚合后的分数,看不到具体某个学号打了多少。但你的 IP、学号、提交时间,后台是留着的,主要用来统计回收率,以及应付「这个班怎么只有 30% 的人评教」这种追问。

真正的风险在开放题。你写「老师您每次下午第一节课就嗓子哑」,这是安全的。你写「就是那个坐第三排穿黑衣服的男生说您例子太旧了」,这个老师能猜出来。

还有一点:认真评教会累,但真的有用。期末那两周,很多老师是盯着主观题那几行字睡觉的。

图片

最后

我认识一个教高等数学的老师,评教连续三年在学院垫底。他上课凶,点名,作业一周一交不能补。但他带的那几个班,考研数学的上线率是全院最高的。

前年他评职称,卡住了。

他跟我说了一句话,原话我记到现在:「我知道我凶。但那帮孩子考上研那天,会明白的。」

我不知道该说什么。我甚至不确定他是对的——也许一个让学生每周都痛苦的老师,本来就不该被这套体系奖励。可我也见过那种课:所有人评教打 99,两年后问学生学过什么,一片沉默。

我现在偶尔还是要填那些表,对着「教学效果:优秀 / 良好 / 合格」这几个选项发呆。光标一闪一闪。我知道这几个格子装不下那节课上某个学生突然抬起头来的样子,装不下一个班四十多双眼睛同时「哦」了一声的那种时刻。

但我还是得点。

点完还得点保存。

🏷️ 标签: