如果你问“美是否主观”,通常会听到两种答案之一:美完全取决于观察者,或者科学已经发现了一套普遍公式。现有证据并不支持任何一个极端。
对于哪些面孔具有吸引力,人们的看法往往会呈现超出随机水平的一致性。与此同时,两个人的偏好也可能存在有意义的差异,而这些差异并不只是噪声。文化、熟悉度、个人经历、具体照片,以及用于计算平均值的人群,都会影响结果。
简短答案:美既有共同成分,也有个人成分
面部吸引力一部分是共同的,一部分是主观的。研究可以估计某个明确群体对一组明确图像的平均反应,但不能把这个平均值变成某个人的客观属性,也不能证明所有观察者都应该达成一致。
这一区别对于人脸评分工具尤其重要。理解 AI 分数的最佳方式是:它是基于模型训练数据或参考数据中所呈现评分的、依赖具体模型的估计。它并不是对美貌、性格、健康或人的价值作出的普遍测量。
科学家如何研究面部吸引力
多数研究会向参与者展示标准化的面部图像,并要求他们使用量表评价吸引力。研究人员随后可以考察两个不同的问题:
- 共同审美:人们对面孔平均排序的认同程度有多高?
- 个人审美:相较于群体平均值的预测,一个人对某些面孔表现出更强偏好的倾向有多稳定?
这两个问题不能互换。一组评分可以产生高度可靠的群体平均值,即使个体观察者之间存在明显分歧。只要评分者足够多,随机差异会相互抵消,平均值便趋于稳定。这种稳定性描述的是该样本的平均结果,并不能证明存在独立于观察者的美貌数值。
研究者 Johannes Hönekopp 直接指出了这一问题。他的分析发现,既存在有意义的共同审美,也存在重要程度大致相当的个人成分。因此,平均评分的高信度系数不应被宣传为“美是客观的”之证明。
关于共同偏好,证据说明了什么?
Judith Langlois 及其同事开展的一项重要荟萃分析综合了多项实验结果。成人和儿童在吸引力判断上都表现出显著一致性,不同文化之间也存在一定程度的共识。这一发现否定了“所有偏好都完全任意”的说法。
共同判断可能来自一些相互重叠的线索,例如一张脸显得典型还是独特、可见的皮肤信息、表情、年龄线索、两性异形、熟悉度,以及图像本身的质量。这些因素彼此作用,而其重要性也会因研究而异。证据并不支持把吸引力简化为一个比例或一张简短的测量清单。
因此,对于用单一数学公式解释美貌的说法,应谨慎看待。更深入的说明请参阅我们关于黄金比例与面部吸引力的证据综述。
个人审美真实存在、可以重复测量,而且影响很大
Laura Germine 及其同事利用大规模线上样本和双胞胎研究了个体审美偏好。在考虑回答一致性之后,作者估计,面孔评分差异中有 48% 反映了两个典型个体之间重叠的共同偏好,52% 反映了个人偏好。这些百分比描述的是方差构成,而不是两个人会对某张脸达成一致的概率。
双胞胎部分尤其有启发意义。同卵双胞胎共享的基因多于异卵双胞胎,一起长大的双胞胎也共享大量家庭环境。然而,拟合效果最佳的模型把可靠的个人偏好差异大多归因于双胞胎之间不共享的经历,以及剩余的测量效应;在该样本中,共同家庭环境的贡献很小。
这一结果并没有识别某个具体原因。它无法说明某段友谊、某部电影、某段关系或某个社交平台创造了一种偏好。它所支持的较窄结论是:个人审美似乎在很大程度上由一个人的独特经历塑造,而不只是由基因或家庭教养决定。
文化会改变人们认为什么有吸引力吗?
跨文化研究同样给出了混合答案。Coetzee 及其同事比较了苏格兰观察者与南非黑人观察者对苏格兰和南非黑人面孔的评分。两组评分呈正相关,说明存在一些共同偏好;不过,对苏格兰面孔的认同程度更高,而且对某类面孔群体的熟悉度似乎也会影响结果。
其他比较传统社会与城市人群的研究发现,人们对面部男性化等特征的偏好会随社会和生态环境变化。Scott 及其同事研究了 12 个人群,并报告称,与高度城市化样本相比,几个小规模社会中的相关偏好更弱或模式不同。
这些研究并没有把世界划分成简单的“国家审美标准”。国家、族群、媒体接触、城市化程度、年龄、性别、性取向和个人经历是不同变量。任何负责任的文章都不能声称自己揭示了每一位美国人、中国人或其他人群成员的偏好。
照片本身也是评分的一部分
即使是同一位观察者,面对同一个人的两张照片时也可能产生不同反应。光线、表情、相机距离、头部角度、仪容、图像质量和情境都会改变印象。关于同一个体内部差异的研究显示,不同照片之间的变化有时可以接近不同人之间的差异。
因此,吸引力评分是对某个时刻、某种具体呈现的反应。我们关于同一张脸为何会产生不同第一印象的指南对此有更详细的解释。
这对 AI 人脸评分意味着什么?
AI 系统会从示例中学习统计关系。如果它的参考标签来自某个特定评分者群体,输出就会倾向于逼近该群体在数据中呈现的模式。换用不同的数据集、指令、图像标准、人群或模型,都可能产生不同估计。
可重复性仍然有用。当照片经过标准化时,一致的模型可以帮助比较不同呈现方式。但一致性不应与普遍有效性混为一谈。温度计使用约定单位测量一种物理量;吸引力模型估计的则是一种会随社会环境和个人而变化的判断。
请把结果当作图像可能如何被感知的一项有限信号。不要用它推断性格、匹配程度、能力、健康、族群或未来成就。
解读评分的实用流程
- 标准化图像。使用均匀光线、与眼睛平齐的构图、自然拍摄距离、清晰对焦,并保证面部无遮挡。请遵循 AI 面部分析照片指南。
- 提交不止一张质量良好的照片。比较中性表情、自然微笑和幅度适中的角度变化。
- 每次只改变一个变量。如果测试光线,请保持姿势和仪容不变。
- 关注范围,而不是命运。不同照片之间的变化揭示了结果对呈现方式的敏感程度。
- 加入人类情境。如果要选择个人资料照片,可以请几位与目标受众相关的人判断哪张图最能传达预期印象。
- 当分析不再有用时就停止。反复评分可能会围绕一个主观概念制造虚假的精确感。
需要牢记的方法学限制
吸引力研究经常使用便利样本、有限年龄范围、二元性别类别、静态照片和简化评分量表。有些研究高度依赖西方、受教育程度较高的人群。群体层面的发现不能预测每个人的反应,相关关系也不能说明某种偏好为何存在。
研究者还会决定照片裁剪方式、表情、图像校准,以及哪些面孔进入研究。这些设计选择都会塑造结果。严谨的科学会报告这些边界,而不是把一种平均效应变成适用于每张脸和每种文化的规则。
常见问题
所以,美真的只存在于观察者眼中吗?
一部分是。观察者之间存在一些共同偏好,但个人审美也有显著贡献。科学上准确的答案并非非此即彼。
AI 能客观测量吸引力吗?
不能。它可以依据数据中呈现的模式和标签,生成可重复的估计。这个估计或许能帮助比较图像,但并不是脱离观察者而存在的真理。
为什么不同照片的分数会变化?
模型接收的是像素,而不是直接接触你的三维面孔。表情、距离、角度、光线、对焦、仪容和遮挡都会改变这些像素。
跨文化共识能证明普遍美吗?
不能。共识说明某些偏好彼此重叠,而偏好强度和方向上的差异则说明文化、熟悉度和个人经历仍然重要。
使用人脸分析最健康的方式是什么?
把它当作针对可控呈现变量的有限反馈,并结合你的目标与了解情境的人类反馈。永远不要把一个分数当成人的价值衡量标准。
同行评审来源
- Langlois, J. H. et al. (2000). "Maxims or Myths of Beauty? A Meta-Analytic and Theoretical Review." Psychological Bulletin, 126(3), 390-423.
- Hönekopp, J. (2006). "Once More: Is Beauty in the Eye of the Beholder?" Journal of Experimental Psychology: Human Perception and Performance, 32(2), 199-209.
- Germine, L. et al. (2015). "Individual Aesthetic Preferences for Faces Are Shaped Mostly by Environments, Not Genes." Current Biology, 25(20), 2684-2689.
- Sutherland, C. A. M., Young, A. W., & Rhodes, G. (2017). "Facial First Impressions From Another Angle: How Social Judgements Are Influenced by Changeable and Invariant Facial Properties." British Journal of Psychology, 108(2), 397-415.
- Coetzee, V. et al. (2014). "Cross-Cultural Agreement in Facial Attractiveness Preferences: The Role of Ethnicity and Gender." PLOS ONE, 9(7), e99629.
- Scott, I. M. L. et al. (2014). "Human Preferences for Sexually Dimorphic Faces May Be Evolutionarily Novel." PNAS, 111(40), 14388-14393.