Mechanistic Interpretability for Bias and Fairness

Systematic review of mechanistic interpretability for bias and fairness in language and vision-language models. Preprint submitted to ACM CSUR.

A systematic review of mechanistic interpretability research on bias and fairness in language and vision-language models.