Un framework python pour calculé la similarité de mots (ou de documents) à partir de gros corpus d'entrainement.
Un article sur comment transformer un dump wikipedia en corpus