Gesicht · Analyse

Was ein schönes Gesicht ausmacht und was es über Gesundheit verrät

Symmetrie, der goldene Schnitt, das Durchschnittsgesicht: Über die Schönheit des Gesichts kursieren viele Regeln. Wir prüfen sie an echten Daten. Dazu haben wir die Form von 102 Gesichtern aus dem Face Research Lab London Set mit Landmarken vermessen und mit 256.326 Attraktivitätsurteilen verglichen. Dazu kommt der Stand der Forschung: was Metaanalysen über Symmetrie, Durchschnittlichkeit und Geschlechtsmerkmale finden, und ob ein schönes Gesicht wirklich Gesundheit verrät.

· 10 Min. Lesezeit · Face Research Lab London Set (DeBruine & Jones 2017), eigene Auswertung; Langlois u. a. (2000); Rhodes (2006); Hönekopp (2006); Germine u. a. (2015); Kalick u. a. (1998); Pound u. a. (2014); Foo u. a. (2017); Cai u. a. (2019); Christensen u. a. (2009); Axelsson u. a. (2010, 2018); Whitehead u. a. (2012)

Liegt Schönheit im Auge des Betrachters?

Das Face Research Lab London Set ist ein frei verfügbarer Forschungsdatensatz der Psychologinnen Lisa DeBruine und Benedict Jones. Er enthält Fotos von 102 Erwachsenen (49 Frauen, 53 Männer), aufgenommen 2012 in London: frontal, neutraler Ausdruck, gleiches Licht. 2.513 Menschen haben jedes dieser Gesichter auf einer Skala von 1 („viel weniger attraktiv als der Durchschnitt“) bis 7 („viel attraktiver als der Durchschnitt“) bewertet, zusammen 256.326 Urteile.

Daraus lässt sich ablesen, wie einig sich Menschen sind. Die Antwort hat zwei Seiten. Zwei einzelne Rater stimmen nur mäßig überein: Ihre Urteile korrelieren im Mittel mit r = 0,35. Vergleicht man einen einzelnen Rater mit dem Urteil aller anderen, liegt die Übereinstimmung bei r = 0,62; bei einem Zehntel der Rater unter 0,41, bei einem anderen Zehntel über 0,74. Ein Teil des Urteils ist also privat, ein Teil Messrauschen, ein Teil geteilt.

Mittelt man aber über mehrere Menschen, heben sich die privaten Vorlieben gegenseitig auf. Schon zehn Rater ergeben ein Urteil mit einer Zuverlässigkeit von 0,84, alle 2.513 zusammen 0,999.

Je mehr Urteile, desto klarer das Bild

Zuverlässigkeit des Mittelwerts aus k Ratern (0 = Zufall, 1 = perfekt reproduzierbar)

Zuverlässigkeit

Werte als Tabelle
Zuverlässigkeit
1 Rater0,35
2 Rater0,52
3 Rater0,62
5 Rater0,73
10 Rater0,84
20 Rater0,91
50 Rater0,96
100 Rater0,98
Ein einzelner Rater stimmt mit einem anderen im Mittel zu r = 0,35 überein; Hochrechnung nach Spearman-Brown. Face Research Lab London Set (DeBruine & Jones 2017, CC BY 4.0): 102 Gesichter, 2.513 Rater; eigene Auswertung

Besonders deutlich wird der geteilte Anteil, wenn man Gruppen vergleicht, von denen man unterschiedlichen Geschmack erwarten würde. Frauen und Männer kommen bei Frauengesichtern auf eine Übereinstimmung von 0,97, bei Männergesichtern auf 0,98. Unter 25-Jährige und über 35-Jährige urteilen ebenso gleich, und auch Menschen, die sich für Männer interessieren, und Menschen, die sich für Frauen interessieren.

Verschiedene Gruppen, fast dasselbe Urteil

Korrelation der Mittelwerte zweier Ratergruppen über die Gesichter

VergleichRater (a / b)FrauengesichterMännergesichter
Frauen – Männer1.552 / 9550,970,98
unter 25 – ab 351.499 / 4250,970,96
an Männern interessiert – an Frauen interessiert1.242 / 7480,970,99
Face Research Lab London Set (DeBruine & Jones 2017, CC BY 4.0): 102 Gesichter, 2.513 Rater; eigene Auswertung

Das deckt sich mit der großen Metaanalyse von Judith Langlois und Kollegen aus dem Jahr 2000. Innerhalb einer Kultur stimmten zwei einzelne Erwachsene im Mittel mit r = 0,47 überein, die Mittelwerte von Rater-Gruppen mit 0,90. Zwischen Kulturen lag die Übereinstimmung der Gruppenmittel sogar bei 0,94. Wie groß der private Anteil ist, haben Johannes Hönekopp (2006) und eine Zwillingsstudie von Laura Germine und Kollegen (2015) mit wiederholten Messungen bestimmt: Rund die Hälfte der verlässlichen Unterschiede im Urteil ist geteilter Geschmack, die andere Hälfte persönlicher. Der persönliche Teil stammt nach der Zwillingsstudie vor allem aus individuellen Erfahrungen, nur zu einem kleinen Teil aus den Genen.

Schönheit liegt etwa zur Hälfte im Auge des Betrachters und zur Hälfte im Gesicht. Über viele Betrachter gemittelt, bleibt fast nur das Gesicht.

Noch ein Nebenbefund: Frauengesichter bekamen im Mittel 3,4 Punkte, Männergesichter 2,7, und zwar von Frauen wie von Männern.

Das Durchschnittsgesicht

1990 legten Judith Langlois und Lori Roggman Fotos von Gesichtern digital übereinander. Die so entstandenen Durchschnittsgesichter wurden attraktiver bewertet als fast alle Einzelgesichter, und umso attraktiver, je mehr Gesichter eingeflossen waren. David Perrett und Kollegen zeigten 1994 in Nature, dass das nicht die ganze Wahrheit ist: Der Durchschnitt der attraktivsten Gesichter wurde dem Durchschnitt aller vorgezogen. Und wenn man dessen Abweichungen vom Gesamtdurchschnitt übertrieb, stieg die Attraktivität weiter.

Wir haben das mit dem London Set nachgestellt. Jedes Foto wurde anhand seiner 189 Landmarken auf die mittlere Form der Gruppe verzerrt, dann wurden die Bilder gemittelt. In der Mitte stehen die Durchschnittsgesichter aller Frauen und aller Männer, links der zehn am schwächsten, rechts der zehn am besten bewerteten.

Durchschnittsgesichter

Jedes Bild ist ein Composite: Fotos auf die mittlere Form verzerrt und übereinandergelegt

Composite-Gesicht Frauen, 10 am schwächsten bewertet
Frauen: 10 am schwächsten bewertet (10)
Composite-Gesicht Frauen, alle
Frauen: alle (49)
Composite-Gesicht Frauen, 10 am besten bewertet
Frauen: 10 am besten bewertet (10)
Composite-Gesicht Männer, 10 am schwächsten bewertet
Männer: 10 am schwächsten bewertet (10)
Composite-Gesicht Männer, alle
Männer: alle (53)
Composite-Gesicht Männer, 10 am besten bewertet
Männer: 10 am besten bewertet (10)
Composites zeigen keine reale Person. Die Fotografierten haben der Verwendung in veränderter Form zur Illustration von Forschung zugestimmt. Face Research Lab London Set (DeBruine & Jones 2017, CC BY 4.0): 102 Gesichter, 2.513 Rater; eigene Auswertung

Drei Dinge fallen auf. Alle Composites wirken glatter und ebenmäßiger als die meisten Einzelfotos, denn Hautunreinheiten und kleine Asymmetrien mitteln sich heraus. Das ist ein Grund, warum Durchschnittsgesichter gefallen, und zugleich ein Einwand gegen die Methode: Sie misst nicht nur Durchschnittlichkeit der Form, sondern auch glattere Haut. Zweitens unterscheiden sich die Composites der am besten und am schwächsten Bewerteten deutlich, wie bei Perrett. Drittens wirken die schwächer Bewerteten älter und haben vollere Gesichter. Das Alter ist im London Set der stärkste einzelne Faktor.

Symmetrie, Durchschnittlichkeit, Geschlechtstypik: was die Daten zeigen

Um die Form zu messen, haben wir 94 Landmarken von Augen, Brauen, Nase, Mund und Kinnlinie verwendet. Ohren, Haaransatz und Kopfumriss haben wir weggelassen, weil sie von Frisur und Kopfhaltung abhängen. Nach einer Procrustes-Analyse, die Größe, Lage und Drehung herausrechnet, bleiben drei Maße:

  • Symmetrie: wie stark ein Gesicht von seinem eigenen Spiegelbild abweicht.
  • Durchschnittlichkeit: wie nah die Form an der mittleren Form des eigenen Geschlechts liegt.
  • Geschlechtstypik: wo die Form auf der Achse zwischen der mittleren Frauen- und der mittleren Männerform liegt.

Was im London Set mit dem Urteil zusammenhängt

Korrelation r mit der mittleren Attraktivität, 95-%-Intervall; rechts von 0 = attraktiver

Werte als Tabelle
Wert (r)95-%-Intervalln
Frauen: Weiblichkeit der Form0,390,12 – 0,6049
Frauen: Durchschnittlichkeit0,360,08 – 0,5849
Frauen: Symmetrie0,11−0,18 – 0,3849
Frauen: jünger0,460,20 – 0,6648
Männer: Männlichkeit der Form−0,09−0,35 – 0,1953
Männer: Durchschnittlichkeit0,12−0,16 – 0,3853
Männer: Symmetrie−0,15−0,41 – 0,1253
Männer: jünger0,340,08 – 0,5652
Symmetrie um die Kopfdrehung im Foto bereinigt. Formmaße aus 94 Landmarken (Procrustes-Analyse). Face Research Lab London Set (DeBruine & Jones 2017, CC BY 4.0): 102 Gesichter, 2.513 Rater; eigene Auswertung

Bei Frauengesichtern hängen zwei der drei Formmaße deutlich mit dem Urteil zusammen. Weiblichere Formen werden besser bewertet (r = 0,39, 95-%-Intervall 0,12 bis 0,60), durchschnittlichere ebenfalls (r = 0,36). Beide Effekte bleiben bestehen, wenn man sie zusammen mit dem Alter betrachtet; das stärkste Gewicht hat dabei die Weiblichkeit (0,31 Standardabweichungen je Standardabweichung). Zusammen erklären die vier Merkmale 39 % der Unterschiede im Urteil.

Weiblichere Gesichtsform, besseres Urteil

49 Frauengesichter; Formindex 0 = mittlere Frauenform, −1 = mittlere Männerform

Werte als Tabelle
Weiblichkeit der FormAttraktivität (1–7)Gruppe
Gesicht 001 (24 J.)0,793,62Frauengesicht
Gesicht 002 (24 J.)0,123,55Frauengesicht
Gesicht 003 (38 J.)0,243,08Frauengesicht
Gesicht 006 (31 J.)−0,242,36Frauengesicht
Gesicht 007 (21 J.)0,713,99Frauengesicht
Gesicht 009 (22 J.)0,664,61Frauengesicht
Gesicht 010 (26 J.)−0,293,23Frauengesicht
Gesicht 011 (36 J.)−0,252,75Frauengesicht
Gesicht 013 (26 J.)−0,202,33Frauengesicht
Gesicht 014 (23 J.)0,043,77Frauengesicht
Gesicht 016 (23 J.)−0,643,05Frauengesicht
Gesicht 019 (24 J.)−0,343,18Frauengesicht
Gesicht 020 (35 J.)−0,802,14Frauengesicht
Gesicht 025 (21 J.)0,043,12Frauengesicht
Gesicht 027 (26 J.)−0,014,85Frauengesicht
Gesicht 030 (24 J.)−0,044,41Frauengesicht
Gesicht 032 (36 J.)0,413,33Frauengesicht
Gesicht 034 (24 J.)−0,012,91Frauengesicht
Gesicht 038 (40 J.)−1,261,58Frauengesicht
Gesicht 039 (27 J.)−0,144,18Frauengesicht
Gesicht 062 (30 J.)0,082,73Frauengesicht
Gesicht 064 (25 J.)−1,032,68Frauengesicht
Gesicht 066 (22 J.)−0,143,82Frauengesicht
Gesicht 081 (25 J.)0,032,95Frauengesicht
Gesicht 083 (21 J.)−0,583,51Frauengesicht
Gesicht 086 (23 J.)−0,204,01Frauengesicht
Gesicht 087 (31 J.)−0,093,40Frauengesicht
Gesicht 090 (29 J.)0,283,07Frauengesicht
Gesicht 091 (20 J.)−0,453,95Frauengesicht
Gesicht 094 (25 J.)0,463,82Frauengesicht
Gesicht 097 (19 J.)−0,583,48Frauengesicht
Gesicht 099 (24 J.)0,233,10Frauengesicht
Gesicht 100 (19 J.)0,104,30Frauengesicht
Gesicht 102 (31 J.)−0,622,18Frauengesicht
Gesicht 107 (41 J.)0,063,51Frauengesicht
Gesicht 112 (29 J.)0,324,38Frauengesicht
Gesicht 113 (33 J.)−0,473,55Frauengesicht
Gesicht 118 (22 J.)−0,033,24Frauengesicht
Gesicht 120 (37 J.)0,672,18Frauengesicht
Gesicht 122 (23 J.)0,273,76Frauengesicht
Gesicht 124 (28 J.)0,315,68Frauengesicht
Gesicht 126 (25 J.)−0,043,86Frauengesicht
Gesicht 127 (28 J.)0,793,58Frauengesicht
Gesicht 129 (21 J.)0,412,50Frauengesicht
Gesicht 134 (21 J.)0,054,06Frauengesicht
Gesicht 135 (? J.)0,222,70Frauengesicht
Gesicht 136 (54 J.)−0,072,29Frauengesicht
Gesicht 139 (25 J.)0,303,81Frauengesicht
Gesicht 144 (27 J.)−0,043,50Frauengesicht
Face Research Lab London Set (DeBruine & Jones 2017, CC BY 4.0): 102 Gesichter, 2.513 Rater; eigene Auswertung

Bei Männergesichtern ist das Bild anders. Weder eine männlichere Form (r = −0,09) noch eine durchschnittlichere (0,12) geht mit einem besseren Urteil einher; die Intervalle schließen null ein. Was bei Männern das Urteil bestimmt, erfassen unsere Formmaße offenbar kaum: Mit dem Alter zusammen erklären sie nur 15 %. Haut, Haare, Bart, Ausdruck und Körperfett dürften einen größeren Anteil haben.

Für Symmetrie finden wir weder bei Frauen (0,11) noch bei Männern (−0,15) einen Zusammenhang. Hier ist allerdings Vorsicht nötig. Schon eine leichte Drehung des Kopfes lässt ein Gesicht im Foto asymmetrisch erscheinen; im London Set korreliert unser Asymmetriemaß mit 0,40 mit der geschätzten Kopfdrehung. Wir haben das herausgerechnet, aber kleine echte Asymmetrien sind auf Fotos kaum von Messfehlern zu trennen, und Messfehler drücken einen Zusammenhang Richtung null.

Was die Forschung insgesamt findet

Ein einzelner Datensatz mit gut hundert Gesichtern kann nur Hinweise geben. Wie stark die drei Merkmale über viele Studien hinweg wirken, hat die australische Psychologin Gillian Rhodes 2006 in einer Metaanalyse zusammengefasst.

Was die Forschung insgesamt findet

Metaanalyse über Dutzende Studien: Effektgröße r mit 95-%-Intervall

Werte als Tabelle
Wert (r)95-%-Intervalln
Durchschnittlichkeit, alle Studien0,520,42 – 0,6145
Durchschnittlichkeit, echte Gesichter0,400,29 – 0,5127
Symmetrie, alle Studien0,250,16 – 0,3363
Symmetrie, echte Gesichter0,230,17 – 0,3042
Frauen: Weiblichkeit, alle Studien0,640,51 – 0,7418
Männer: Männlichkeit, alle Studien−0,12−0,35 – 0,1422
Männer: Männlichkeit, echte Gesichter0,350,23 – 0,4510
n = Zahl der Gesichtsstichproben. „Alle Studien“ schließt am Computer veränderte Gesichter ein, „echte Gesichter“ nur unveränderte Fotos. Rhodes (2006), Annual Review of Psychology 57, Tabelle 1

Am stärksten wirkt Weiblichkeit bei Frauengesichtern (r = 0,64). Durchschnittlichkeit wirkt deutlich, bei echten, unveränderten Gesichtern mit r = 0,40. Symmetrie wirkt schwächer (r = 0,23). Am uneinheitlichsten ist Männlichkeit bei Männergesichtern: In Studien mit echten Gesichtern wirkt sie positiv (r = 0,35), über alle Studien gemittelt nicht (−0,12), weil am Computer vermännlichte Gesichter oft als weniger attraktiv beurteilt werden.

Unsere Ergebnisse passen gut zu diesem Bild, mit zwei Abweichungen: Symmetrie und männliche Form zeigen im London Set gar keinen Zusammenhang. Bei der kleinen Stichprobe ist beides mit den Werten der Metaanalyse vereinbar; die Intervalle überlappen.

Haut: das unterschätzte Signal

Die meisten Studien zur Schönheit messen die Form. Doch wie die Composites zeigen, spielt die Haut eine große Rolle. Ebenmäßige Hauttextur und gleichmäßige Hautfarbe gehen in mehreren Studien mit höherer Attraktivität, Gesundheit und Jugendlichkeit einher (Fink u. a. 2001; Matts u. a. 2007). Benedict Jones und Kollegen schätzten 2021, dass die Weiblichkeit der Form allein nur etwa 11 % der Unterschiede in der Attraktivität erklärt, ein Modell aus Form und Farbe zusammen etwa 40 %.

Ein bekanntes Beispiel ist die Hautfarbe durch Ernährung. Wer mehr Obst und Gemüse isst, lagert Carotinoide in der Haut ein, die sie gelblicher und rosiger machen. In einer kleinen Studie von Ross Whitehead und Kollegen (2012) mit 35 Teilnehmern waren solche Veränderungen nach sechs Wochen messbar, nach drei Wochen noch nicht. Die Studie wurde von einem Lebensmittelkonzern gefördert und untersuchte nur helle Haut. Eine andere Studie fand keinen Einfluss der Hautfarbe auf die Attraktivität (Foo u. a. 2017). Das Thema ist weniger gesichert, als populäre Darstellungen nahelegen.

Verrät das Gesicht Gesundheit?

Die einflussreichste Erklärung für Schönheit stammt aus der Evolutionsbiologie: Symmetrie, Durchschnittlichkeit und ausgeprägte Geschlechtsmerkmale seien Zeichen guter Gene und eines robusten Immunsystems, und wer sie attraktiv findet, wähle gesündere Partner. Die Idee ist elegant, aber sie lässt sich prüfen. Man muss nur Gesichter mit tatsächlich gemessener Gesundheit vergleichen.

Verrät Attraktivität echte Gesundheit?

Studien, die Gesichter mit gemessener Gesundheit verglichen haben

StudieStichprobeGemessenErgebnis
Kalick u. a. 1998333 Jugendliche (Fotos), Gesundheit damals und späterAttraktivitätkein Zusammenhang mit Gesundheit; Attraktive wurden fälschlich für gesünder gehalten
Rhodes u. a. 2001Gesichtsfotos mit GesundheitsdatenSymmetrie, DurchschnittlichkeitSymmetrie: kein Zusammenhang; sehr untypische Gesichter teils etwas weniger gesund
Pound u. a. 20144.732 Jugendliche (3D-Scans, ALSPAC)Asymmetriekein Zusammenhang mit Krankheiten in der Kindheit
Foo u. a. 2017181 junge ErwachseneImmunfunktion, oxidativer Stress, Spermienqualitätnur schwache, teils widersprüchliche Zusammenhänge
Cai u. a. 2019590 Frauen, 221 mit Immunmarker (IgA)Infektanfälligkeitkein Zusammenhang mit Attraktivität, Weiblichkeit, Durchschnittlichkeit oder Hautfarbe
Christensen u. a. 20091.826 Zwillinge ab 70geschätztes Alterälter Aussehende starben früher (+8 % Risiko je Jahr, bereinigt um das echte Alter)
Axelsson u. a. 2018Fotos vor und nach Endotoxin-Gabeakute KrankheitKranke über Zufall erkannt (blasse Lippen und Haut, hängende Lider)
Originalarbeiten, siehe Quellenverzeichnis

Die Ergebnisse sind ernüchternd. Kalick und Kollegen fanden 1998 an Fotos von 333 Jugendlichen keinen Zusammenhang zwischen Attraktivität und Gesundheit, damals oder später. Die Betrachter hielten attraktive Menschen trotzdem für gesünder; ihre Gesundheitsurteile wurden sogar treffsicherer, wenn man die Attraktivität herausrechnete. Die bislang größte Studie zur Symmetrie (Pound u. a. 2014) vermaß die Gesichter von 4.732 britischen Jugendlichen in 3D und fand keinen Zusammenhang mit Krankheiten in der Kindheit. Studien mit Immunmarkern finden nur schwache oder keine Zusammenhänge (Foo u. a. 2017; Cai u. a. 2019). Jones und Kollegen schreiben 2021, die Immunkompetenz-Hypothese habe „wenig überzeugende empirische Unterstützung“.

Das heißt nicht, dass das Gesicht nichts über Gesundheit verrät. Es verrät nur anderes, als die Theorie annahm. Gut belegt sind drei Signale:

  • Wie alt jemand wirkt. In einer dänischen Studie mit 1.826 Zwillingen ab 70 Jahren starben Menschen, die älter aussahen, früher: je Jahr geschätzten Alters stieg das Sterberisiko um 8 %, bei gleichem tatsächlichem Alter (Christensen u. a. 2009). Innerhalb von Zwillingspaaren starb häufiger der älter Aussehende zuerst.
  • Schlafmangel. Nach 31 Stunden ohne Schlaf wirkten Menschen auf Fotos weniger gesund, weniger attraktiv und müder (Axelsson u. a. 2010); schon zwei Nächte mit zu wenig Schlaf reichten für einen messbaren Effekt (Sundelin u. a. 2017).
  • Akute Krankheit. Zwei Stunden nach einer Injektion von bakteriellem Endotoxin, die das Immunsystem kurzzeitig aktiviert, erkannten Betrachter die Kranken auf Fotos häufiger als per Zufall: an blasseren Lippen und Haut, einem geschwolleneren Gesicht, hängenden Lidern und Mundwinkeln (Axelsson u. a. 2018).

Das Gesicht zeigt also eher den aktuellen Zustand und den Lebensstil als die genetische Ausstattung. Jones und Kollegen schlagen deshalb vor, Schönheit als Signal für Ernährung, Gewicht und Lebensweise zu untersuchen statt als Signal für Immunkompetenz.

Warum das wichtig ist: der Halo-Effekt

Ob Schönheit Gesundheit signalisiert oder nicht: Sie hat Folgen. Die Metaanalyse von Langlois und Kollegen fand, dass attraktive Erwachsene positiver beurteilt (d = 0,50) und besser behandelt werden (d = 0,54). Wer attraktiv ist, wird für kompetenter, sozialer und gesünder gehalten, obwohl die Unterschiede in tatsächlicher Intelligenz praktisch null sind (d = 0,07). Am Arbeitsmarkt zeigte die klassische Studie von Daniel Hamermesh und Jeff Biddle (1994) einen Lohnabschlag von 5 bis 10 % für unterdurchschnittlich Attraktive. In einem Experiment von Markus Mobius und Tanya Rosenblat (2006) bekamen attraktivere Bewerber 12 bis 13 % mehr Lohn je Standardabweichung Attraktivität, sobald Arbeitgeber ein Foto sahen oder mit ihnen telefonierten. Wer nur den Lebenslauf sah, zahlte keinen Aufschlag.

Alle Studien mit Prüfstatus stehen im Quellenverzeichnis. Die Auswertung des London Set ist mit Code nachvollziehbar.

SchönheitAttraktivitätGesichtSymmetrieDurchschnittlichkeitWeiblichkeitMännlichkeitCompositeGesundheitHalo-EffektMetaanalyse