Jaebok Kim, Khiet P. Truong, Gwenn Englebienne, Vanessa Evers: Learning spectro-temporal features with 3D CNNs for speech emotion recognition. ACII 2017: 383-388