工作现场,才是能力的证词
一个候选人在面试里回答流畅,和他能否把工作做好,是两个相关却不相同的问题。若岗位本来就要求现场讲解、谈判或应对客户,表达可以成为能力证据;若岗位核心是查错、护理、编程或维护,谈得漂亮至多说明他擅长这场谈话。
工作现场,才是能力的证词
一个候选人在面试里回答流畅,和他能否把工作做好,是两个相关却不相同的问题。若岗位本来就要求现场讲解、谈判或应对客户,表达可以成为能力证据;若岗位核心是查错、护理、编程或维护,谈得漂亮至多说明他擅长这场谈话。
招聘最容易犯的错,是先对一个人形成完整印象,再去寻找支持它的材料。更稳妥的顺序正好相反:先说明工作要产生什么结果,再决定哪种任务、问题或记录能够提供相关证据,最后按事前规则组合。所谓“识人”,在这里要缩小成一项可以检验的工作:预测一个人在具体岗位、具体条件下的表现。
先检查“好员工”是怎样定义的
招聘工具的效度,必须相对于某个后续结果来谈。主管总评、产量、质量、安全、协作、留任和培训成绩,并不是同一个效标。只看销量,可能漏掉合规、返工和团队成本;只看留任,也可能把缺少其他机会误写成投入。
效标本身还会被污染。主管若知道某人的原面试分,“高潜”员工又得到更多项目、培训和容错,后来的高评分便不全是初始能力的证明。相反,一项岗位的重要表现若从未进入考核,就是效标缺失。组织在比较甄选工具之前,得先问自己究竟在奖励什么、漏掉什么。
范围限制同样会制造确定感。落选者没有入职后的绩效资料,已录用者的分数范围又较窄,样本相关不等于全部申请人的关系。校正可能必要,但没有可信的选择机制和分布,过度校正也会把弱证据放大。
名声与眼见都可能误人
曹魏刘劭《人物志》讨论官僚人才、才性与任用。《材能》说“夫人材不同,能各有异”,可以提醒今天的组织:能力不是脱离任务的单一总分。《七缪》又谈誉毁、爱恶、处境和外貌言辞怎样扰乱判断,并说“知人者,以目正耳”“有所誉,必有所试”。这里的“目”是用亲察校正传闻,不是看脸、面相或微表情;“试”也不等于任意测试。
《人物志》处在汉魏选官与等级秩序中,没有现代劳动权、反歧视、残障便利和隐私观念。它没有发明结构化招聘,只留下一个仍有用的疑问:声誉之后,能否看到与任事相关的表现?
柏拉图《高尔吉亚》459a—c 则追问,一个不具专业知识的修辞者,是否仍能在同样不懂的人群中显得比真正懂行者更可信。这是关于修辞、技艺与正当生活的哲学论辩,不是人员甄选研究。它能帮助招聘者区分两个成绩:让听众相信,与把事情做好。
但也不能走向另一个极端。说服、教学、写作若属于岗位任务,就应设计成有情境、有标准的工作样本,而非因古典文本对修辞的警惕而被删掉。
面试不是一种方法
自由聊天、结构化过去行为题、情境题、小组面试和岗位知识问答,都叫面试,证据性质却不同。McDaniel 等人 1994 年的元分析,以及 Levashina 等人 2014 年的综述,都要求把内容、结构、评分和效标拆开。结构化不只是“每人问同样的问题”,还包括岗位分析、预定追问边界、评分锚、评分者训练、独立记录和固定组合方式。
这种设计不能消除所有偏差,却能减少面试官在喜欢某位候选人后临时改变标准。面试焦虑和自我呈现研究也提示,分数可能同时反映岗位能力、对面试形式的熟悉和当场状态。自信、眼神、口音或“聊得来”不能偷偷改名为胜任力。
工作样本让证据更接近工作,但仍不是免检答案。任务是否代表岗位,评分者能否一致,入职后可学的内容是否被误设为门槛,候选人是否被要求无偿完成真实商业产出,都要检查。无法安全模拟的医疗、驾驶、工业或金融责任,更不能交给申请者现场承担。
认知与技能测验、情境判断测验、人格工具和推荐材料也各有窄用途。题目外形相似,不表示测到同一能力;推荐人声望不能替代观察范围;申请情境里的理想化回答也不能直接诊断谁在撒谎。
平均排名不能替本岗位作决定
Schmidt 与 Hunter 1998 年综合当时多类甄选程序,长期影响了工具效度的排序讨论。那不是一次覆盖“八十五年所有员工”的原始研究,表中校正值也依赖范围限制、测量误差和跨岗位推广假设。相关系数不能翻译成“识人准确率”。
Sackett 等人 2022 年重新审查范围限制校正,认为旧方法存在系统性过校正;重估后,平均效度普遍降低,结构化面试在其综合中居前。Berry 等人 2024 年又以更新矩阵模拟工具组合,显示在特定输入和目标下,排除一般认知测验可能只损失很少预测效度,却明显减轻群体不利后果。
这些更新没有给所有组织一张新排行榜。它们推翻的是“单项平均最高,所以任何岗位都应固定使用”的推理。工具之间会共享信息,岗位不同,选择率、效标和群体后果也不同;组合必须重新验证。
把评估与相互了解分成两条轨道
候选人也在判断组织。开放交流可以让他们了解真实任务、管理方式、困难、工作条件和发展机会。现实岗位预览研究说明,这类信息会影响期望、退出和离职等结果。它的价值不必冒充绩效预测。
因此,招聘可以分成两段。评估段使用统一任务、问题、时间和评分,评分者先独立记录;信息段允许候选人自由提问,团队如实介绍工作。除非交流中出现依法必须处理且与岗位相关的明确事实,否则聊天风格和相似感不回填为隐性分数。若沟通本身属于工作,就把它移入评估段,明确观察行为和评分标准。
输入取得以后,组合规则应在看到候选人之前固定。Kuncel 等人 2013 年的元分析支持,事前固定的规则通常比评估者事后凭整体感觉改权重更一致。固定规则并不等于 AI,更不保证输入有效或公平;一堆无关分数按公式相加,仍然只是可重复的错误。
建一张岗位证据矩阵
每项核心要求至少登记:要预测的工作结果;首要证据;补充证据;不得偷渡的替代指标;评分和组合规则;便利安排;群体与候选人后果;入职后的复核指标。
例如,当前可执行的技术任务可用小型、代表性且低负担的工作样本,辅以结构化问题;学校名、术语流利和自信不能替代实际表现。判断与协作可用岗位化情境模拟和过去行为证据,却不能用“文化契合”或饭局聊天。任职事实核验也应与第三方对能力的评价分开。
公平不是在流程末端补一行选择率。测试语言、时间、设备、感官和动作要求若不是岗位目标,就可能制造无关障碍。候选人需要知道主要评价类型、资料用途和便利渠道,并能更正事实错误。美国四分之五规则只是一项法域中的经验筛查规则,不是无歧视证明,更不是台湾、香港、中国大陆或东南亚的共同法律。
真正可靠的招聘不会承诺看透一个人。它只要求每一项判断都回到工作:测什么,为什么测,谁可能被无关条件挡住,结果入职后能否复核。证据越接近任务,规则越能在见人之前说清,组织就越少把魅力、熟悉感和声誉误当成能力。
出处与限制
- 刘劭撰、刘昞注《人物志·材能》《八观》《七缪》,中国哲学书电子化计划目录与电子文本:https://ctext.org/wiki.pl?chapter=126221、https://ctext.org/wiki.pl?chapter=863871&remap=gb;推荐核字校本为《人物志校笺》(中华书局,2025)。本文只短引古文并独立释义,不复制现代校笺、标点、注释或今译;CText 转录须防 OCR/用户编辑误差。
- Plato, Gorgias 459a—c, 462b—465a,Perseus 定位:https://www.perseus.tufts.edu/hopper/text?doc=Perseus:text:1999.01.0178:text=Gorg.;Jowett 公版英译:https://www.gutenberg.org/ebooks/1672。本文按 Stephanus 号独立转述,不把哲学论辩冒充招聘效度研究。
- Schmidt, F. L. & Hunter, J. E. (1998):https://doi.org/10.1037/0033-2909.124.2.262;Sackett, P. R. et al. (2022):https://doi.org/10.1037/apl0000994;Berry, C. M. et al. (2024):https://doi.org/10.1037/apl0001203。三者须作为经典综合、范围限制重估和特定矩阵组合模拟连续阅读,不提供跨岗位统一排名或成功率。
- McDaniel, M. A. et al. (1994):https://doi.org/10.1037/0021-9010.79.4.599;Levashina, J. et al. (2014):https://doi.org/10.1111/peps.12052;Powell, D. M. et al. (2018):https://doi.org/10.1037/cbs0000108;Barrick, M. R. et al. (2009):https://doi.org/10.1037/a0016532。面试内容、结构、效标、焦虑与自我呈现证据不能合并成一个跨岗位有效率。
- Roth, P. L. et al. (2005):https://doi.org/10.1111/j.1744-6570.2005.00714.x;Roth, P. L. et al. (2008):https://doi.org/10.1111/j.1744-6570.2008.00125.x。工作样本的代表性、评分、群体差异与候选人权利须逐任务检查,不能因“像工作”就推定无偏。
- Hausknecht, J. P. et al. (2004):https://doi.org/10.1111/j.1744-6570.2004.00003.x;Phillips, J. M. (1998):https://doi.org/10.5465/256964;Kuncel, N. R. et al. (2013):https://doi.org/10.1037/a0034156。候选人接受度、现实岗位预览和机械组合分别回答不同问题,不能互相替代。
- SIOP, Principles for the Validation and Use of Personnel Selection Procedures (2018);AERA/APA/NCME, Standards for Educational and Psychological Testing:https://www.testingstandards.net/;美国 EEOC 甄选程序说明:https://www.eeoc.gov/laws/guidance/employment-tests-and-selection-procedures;香港个人资料私隐专员公署人力资源管理实务守则:https://www.pcpd.org.hk/english/data_privacy_law/code_of_practices/code_hrm_1.html。这些原则与实例不替代各地现行法律意见。
- 本文是一般研究框架,不提供特定岗位测评、法律或人事决策。心理测验、残障便利、背景调查、敏感资料、跨境传输及自动化招聘须由当地 HR、测量、法务与数据保护专业人员按岗位和法域复核;本文不为视频、面部、声音、情绪或生成式 AI 推断背书。
版本说明
简体中文为研究母稿,实质修订将记录日期并重新经过受影响门禁。
> 编辑状态:本文已完成独立事实与版权审校、匿名盲审及文字终校,并于 2026-07-18 获总编辑批准,进入分批发行。