Mechanistic Interpretability for Bias and Fairness
Systematic review of mechanistic interpretability for bias and fairness in language and vision-language models. Preprint submitted to ACM CSUR.
A systematic review of mechanistic interpretability research on bias and fairness in language and vision-language models.