笠翁堂文章

工作现场,才是能力的证词

一个候选人在面试里回答流畅,和他能否把工作做好,是两个相关却不相同的问题。若岗位本来就要求现场讲解、谈判或应对客户,表达可以成为能力证据;若岗位核心是查错、护理、编程或维护,谈得漂亮至多说明他擅长这场谈话。

组织与制度

工作现场,才是能力的证词

一个候选人在面试里回答流畅,和他能否把工作做好,是两个相关却不相同的问题。若岗位本来就要求现场讲解、谈判或应对客户,表达可以成为能力证据;若岗位核心是查错、护理、编程或维护,谈得漂亮至多说明他擅长这场谈话。

招聘最容易犯的错,是先对一个人形成完整印象,再去寻找支持它的材料。更稳妥的顺序正好相反:先说明工作要产生什么结果,再决定哪种任务、问题或记录能够提供相关证据,最后按事前规则组合。所谓“识人”,在这里要缩小成一项可以检验的工作:预测一个人在具体岗位、具体条件下的表现。

先检查“好员工”是怎样定义的

招聘工具的效度,必须相对于某个后续结果来谈。主管总评、产量、质量、安全、协作、留任和培训成绩,并不是同一个效标。只看销量,可能漏掉合规、返工和团队成本;只看留任,也可能把缺少其他机会误写成投入。

效标本身还会被污染。主管若知道某人的原面试分,“高潜”员工又得到更多项目、培训和容错,后来的高评分便不全是初始能力的证明。相反,一项岗位的重要表现若从未进入考核,就是效标缺失。组织在比较甄选工具之前,得先问自己究竟在奖励什么、漏掉什么。

范围限制同样会制造确定感。落选者没有入职后的绩效资料,已录用者的分数范围又较窄,样本相关不等于全部申请人的关系。校正可能必要,但没有可信的选择机制和分布,过度校正也会把弱证据放大。

名声与眼见都可能误人

曹魏刘劭《人物志》讨论官僚人才、才性与任用。《材能》说“夫人材不同,能各有异”,可以提醒今天的组织:能力不是脱离任务的单一总分。《七缪》又谈誉毁、爱恶、处境和外貌言辞怎样扰乱判断,并说“知人者,以目正耳”“有所誉,必有所试”。这里的“目”是用亲察校正传闻,不是看脸、面相或微表情;“试”也不等于任意测试。

《人物志》处在汉魏选官与等级秩序中,没有现代劳动权、反歧视、残障便利和隐私观念。它没有发明结构化招聘,只留下一个仍有用的疑问:声誉之后,能否看到与任事相关的表现?

柏拉图《高尔吉亚》459a—c 则追问,一个不具专业知识的修辞者,是否仍能在同样不懂的人群中显得比真正懂行者更可信。这是关于修辞、技艺与正当生活的哲学论辩,不是人员甄选研究。它能帮助招聘者区分两个成绩:让听众相信,与把事情做好。

但也不能走向另一个极端。说服、教学、写作若属于岗位任务,就应设计成有情境、有标准的工作样本,而非因古典文本对修辞的警惕而被删掉。

面试不是一种方法

自由聊天、结构化过去行为题、情境题、小组面试和岗位知识问答,都叫面试,证据性质却不同。McDaniel 等人 1994 年的元分析,以及 Levashina 等人 2014 年的综述,都要求把内容、结构、评分和效标拆开。结构化不只是“每人问同样的问题”,还包括岗位分析、预定追问边界、评分锚、评分者训练、独立记录和固定组合方式。

这种设计不能消除所有偏差,却能减少面试官在喜欢某位候选人后临时改变标准。面试焦虑和自我呈现研究也提示,分数可能同时反映岗位能力、对面试形式的熟悉和当场状态。自信、眼神、口音或“聊得来”不能偷偷改名为胜任力。

工作样本让证据更接近工作,但仍不是免检答案。任务是否代表岗位,评分者能否一致,入职后可学的内容是否被误设为门槛,候选人是否被要求无偿完成真实商业产出,都要检查。无法安全模拟的医疗、驾驶、工业或金融责任,更不能交给申请者现场承担。

认知与技能测验、情境判断测验、人格工具和推荐材料也各有窄用途。题目外形相似,不表示测到同一能力;推荐人声望不能替代观察范围;申请情境里的理想化回答也不能直接诊断谁在撒谎。

平均排名不能替本岗位作决定

Schmidt 与 Hunter 1998 年综合当时多类甄选程序,长期影响了工具效度的排序讨论。那不是一次覆盖“八十五年所有员工”的原始研究,表中校正值也依赖范围限制、测量误差和跨岗位推广假设。相关系数不能翻译成“识人准确率”。

Sackett 等人 2022 年重新审查范围限制校正,认为旧方法存在系统性过校正;重估后,平均效度普遍降低,结构化面试在其综合中居前。Berry 等人 2024 年又以更新矩阵模拟工具组合,显示在特定输入和目标下,排除一般认知测验可能只损失很少预测效度,却明显减轻群体不利后果。

这些更新没有给所有组织一张新排行榜。它们推翻的是“单项平均最高,所以任何岗位都应固定使用”的推理。工具之间会共享信息,岗位不同,选择率、效标和群体后果也不同;组合必须重新验证。

把评估与相互了解分成两条轨道

候选人也在判断组织。开放交流可以让他们了解真实任务、管理方式、困难、工作条件和发展机会。现实岗位预览研究说明,这类信息会影响期望、退出和离职等结果。它的价值不必冒充绩效预测。

因此,招聘可以分成两段。评估段使用统一任务、问题、时间和评分,评分者先独立记录;信息段允许候选人自由提问,团队如实介绍工作。除非交流中出现依法必须处理且与岗位相关的明确事实,否则聊天风格和相似感不回填为隐性分数。若沟通本身属于工作,就把它移入评估段,明确观察行为和评分标准。

输入取得以后,组合规则应在看到候选人之前固定。Kuncel 等人 2013 年的元分析支持,事前固定的规则通常比评估者事后凭整体感觉改权重更一致。固定规则并不等于 AI,更不保证输入有效或公平;一堆无关分数按公式相加,仍然只是可重复的错误。

建一张岗位证据矩阵

每项核心要求至少登记:要预测的工作结果;首要证据;补充证据;不得偷渡的替代指标;评分和组合规则;便利安排;群体与候选人后果;入职后的复核指标。

例如,当前可执行的技术任务可用小型、代表性且低负担的工作样本,辅以结构化问题;学校名、术语流利和自信不能替代实际表现。判断与协作可用岗位化情境模拟和过去行为证据,却不能用“文化契合”或饭局聊天。任职事实核验也应与第三方对能力的评价分开。

公平不是在流程末端补一行选择率。测试语言、时间、设备、感官和动作要求若不是岗位目标,就可能制造无关障碍。候选人需要知道主要评价类型、资料用途和便利渠道,并能更正事实错误。美国四分之五规则只是一项法域中的经验筛查规则,不是无歧视证明,更不是台湾、香港、中国大陆或东南亚的共同法律。

真正可靠的招聘不会承诺看透一个人。它只要求每一项判断都回到工作:测什么,为什么测,谁可能被无关条件挡住,结果入职后能否复核。证据越接近任务,规则越能在见人之前说清,组织就越少把魅力、熟悉感和声誉误当成能力。

出处与限制

版本说明

简体中文为研究母稿,实质修订将记录日期并重新经过受影响门禁。

> 编辑状态:本文已完成独立事实与版权审校、匿名盲审及文字终校,并于 2026-07-18 获总编辑批准,进入分批发行。