ENGLISH

Speech and Computer : 19th International Conference, SPECOM 2017, Hatfield, UK, September 12-16, 2017, Proceedings

Book information

Year
2017
ISBN
978-3-319-66429-3, 3319664298, 978-3-319-66428-6
Language
english
Format
PDF
Filesize
66 MB (69597528 bytes)
Series
Lecture Notes in Computer Science 10458
Pages
831\845
Time added
2017-10-15 16:00:00

Description

This book constitutes the proceedings of the 19th International Conference on Speech and Computer, SPECOM 2017, held in Hatfield, UK, in September 2017. The 80 papers presented in this volume were carefully reviewed and selected from 150 submissions. The papers present current research in the area of computer speech processing (recognition, synthesis, understanding etc.) and related domains (including signal processing, language and text processing, computational paralinguistics, multi-modal speech processing, human-computer interaction). Front Matter ....Pages I-XV Front Matter ....Pages 1-1 Low-Resource Speech Recognition and Keyword-Spotting (Mark J. F. Gales, Kate M. Knill, Anton Ragni)....Pages 3-19 Big Data, Deep Learning – At the Edge of X-Ray Speaker Analysis (Björn W. Schuller)....Pages 20-34 Front Matter ....Pages 35-35 A Comparison of Covariance Matrix and i-vector Based Speaker Recognition (Nikša Jakovljević, Ivan Jokić, Slobodan Jošić, Vlado Delić)....Pages 37-45 A Trainable Method for the Phonetic Similarity Search in German Proper Names (Oliver Jokisch, Horst-Udo Hain)....Pages 46-55 Acoustic and Perceptual Correlates of Vowel Articulation in Parkinson’s Disease With and Without Mild Cognitive Impairment: A Pilot Study (Michaela Strinzel, Vasilisa Verkhodanova, Fedor Jalvingh, Roel Jonkers, Matt Coler)....Pages 56-64 Acoustic Cues for the Perceptual Assessment of Surround Sound (Ingo Siegert, Oliver Jokisch, Alicia Flores Lotz, Franziska Trojahn, Martin Meszaros, Michael Maruschke)....Pages 65-75 Acoustic Modeling in the STC Keyword Search System for OpenKWS 2016 Evaluation (Ivan Medennikov, Aleksei Romanenko, Alexey Prudnikov, Valentin Mendelev, Yuri Khokhlov, Maxim Korenevsky et al.)....Pages 76-86 Adaptation Approaches for Pronunciation Scoring with Sparse Training Data (Federico Landini, Luciana Ferrer, Horacio Franco)....Pages 87-97 An Algorithm for Detection of Breath Sounds in Spontaneous Speech with Application to Speaker Recognition (Sri Harsha Dumpala, K. N. R. K. Raju Alluri)....Pages 98-108 An Alternative Approach to Exploring a Video (Fahim A. Salim, Fasih Haider, Owen Conlan, Saturnino Luz)....Pages 109-118 An Analysis of the RNN-Based Spoken Term Detection Training (Jan Švec, Luboš Šmídl, Josef V. Psutka)....Pages 119-129 Analysis of Interaction Parameter Levels in Interaction Quality Modelling for Human-Human Conversation (Anastasiia Spirina, Olesia Vaskovskaia, Tatiana Karaseva, Alina Skorokhod, Iana Polonskaia, Maxim Sidorov)....Pages 130-140 Annotation Error Detection: Anomaly Detection vs. Classification (Jindřich Matoušek, Daniel Tihelka)....Pages 141-151 Are You Addressing Me? Multimodal Addressee Detection in Human-Human-Computer Conversations (Oleg Akhtiamov, Dmitrii Ubskii, Evgeniia Feldina, Aleksei Pugachev, Alexey Karpov, Wolfgang Minker)....Pages 152-161 Assessing Spoken Dialog Services from the End-User Perspective: Usability and Experience (Otilia Kocsis, Basilis Kladis, Anastasios Tsopanoglou, Nikos Fakotakis)....Pages 162-170 Audio-Replay Attack Detection Countermeasures (Galina Lavrentyeva, Sergey Novoselov, Egor Malykh, Alexander Kozlov, Oleg Kudashev, Vadim Shchemelinin)....Pages 171-181 Automatic Estimation of Presentation Skills Using Speech, Slides and Gestures (Abualsoud Hanani, Mohammad Al-Amleh, Waseem Bazbus, Saleem Salameh)....Pages 182-191 Automatic Phonetic Transcription for Russian: Speech Variability Modeling (Vera Evdokimova, Pavel Skrelin, Tatiana Chukaeva)....Pages 192-199 Automatic Smoker Detection from Telephone Speech Signals (Amir Hossein Poorjam, Soheila Hesaraki, Saeid Safavi, Hugo van Hamme, Mohamad Hasan Bahari)....Pages 200-210 Bimodal Anti-Spoofing System for Mobile Security (Eugene Luckyanets, Aleksandr Melnikov, Oleg Kudashev, Sergey Novoselov, Galina Lavrentyeva)....Pages 211-220 Canadian English Word Stress: A Corpora-Based Study of National Identity in a Multilingual Community (Tatiana Shevchenko, Daria Pozdeeva)....Pages 221-232 Classification of Formal and Informal Dialogues Based on Turn-Taking and Intonation Using Deep Neural Networks (István Szekrényes, György Kovács)....Pages 233-243 Clustering Target Speaker on a Set of Telephone Dialogs (Andrey Shulipa, Aleksey Sholohov, Yuri Matveev)....Pages 244-252 Cognitive Entropy in the Perceptual-Auditory Evaluation of Emotional Modal States of Foreign Language Communication Partner (Rodmonga Potapova, Vsevolod Potapov)....Pages 253-261 Correlation Normalization of Syllables and Comparative Evaluation of Pronunciation Quality in Speech Rehabilitation (Evgeny Kostyuchenko, Roman Meshcheryakov, Dariya Ignatieva, Alexander Pyatkov, Evgeny Choynzonov, Lidiya Balatskaya)....Pages 262-271 CRF-Based Phrase Boundary Detection Trained on Large-Scale TTS Speech Corpora (Markéta Jůzová)....Pages 272-281 Deep Recurrent Neural Networks in Speech Synthesis Using a Continuous Vocoder (Mohammed Salah Al-Radhi, Tamás Gábor Csapó, Géza Németh)....Pages 282-291 Design of Online Echo Canceller in Duplex Mode (Andrey Barabanov, Evgenij Vikulov)....Pages 292-301 Detection of Stance and Sentiment Modifiers in Political Blogs (Maria Skeppstedt, Vasiliki Simaki, Carita Paradis, Andreas Kerren)....Pages 302-311 Digits to Words Converter for Slavic Languages in Systems of Automatic Speech Recognition (Josef Chaloupka)....Pages 312-321 Discriminating Speakers by Their Voices — A Fusion Based Approach (Halim Sayoud, Siham Ouamour, Zohra Hamadache)....Pages 322-331 Emotional Poetry Generation (Aitzol Astigarraga, José María Martínez-Otzeta, Igor Rodriguez, Basilio Sierra, Elena Lazkano)....Pages 332-342 End-to-End Large Vocabulary Speech Recognition for the Serbian Language (Branislav Popović, Edvin Pakoci, Darko Pekar)....Pages 343-352 Examining the Impact of Feature Selection on Sentiment Analysis for the Greek Language (Nikolaos Spatiotis, Michael Paraskevas, Isidoros Perikos, Iosif Mporas)....Pages 353-361 Experimenting with Hybrid TDNN/HMM Acoustic Models for Russian Speech Recognition (Irina Kipyatkova)....Pages 362-369 Exploring Multiparty Casual Talk for Social Human-Machine Dialogue (Emer Gilmartin, Benjamin R. Cowan, Carl Vogel, Nick Campbell)....Pages 370-378 First Experiments to Detect Anomaly Using Personality Traits vs. Prosodic Features (Cedric Fayet, Arnaud Delhay, Damien Lolive, Pierre-François Marteau)....Pages 379-388 Fusion of a Novel Volterra-Wiener Filter Based Nonlinear Residual Phase and MFCC for Speaker Verification (Purvi Agrawal, Hemant A. Patil)....Pages 389-397 Hesitations in Spontaneous Speech: Acoustic Analysis and Detection (Vasilisa Verkhodanova, Vladimir Shapranov, Irina Kipyatkova)....Pages 398-406 Human as Acmeologic Entity in Social Network Discourse (Multidimensional Approach) (Rodmonga Potapova, Vsevolod Potapov)....Pages 407-416 Improved Speaker Adaptation by Combining I-vector and fMLLR with Deep Bottleneck Networks (Thai Son Nguyen, Kevin Kilgour, Matthias Sperber, Alex Waibel)....Pages 417-426 Improving of LVCSR for Causal Czech Using Publicly Available Language Resources (Petr Mizera, Petr Pollak)....Pages 427-437 Improving Performance of Speaker Identification Systems Using Score Level Fusion of Two Modes of Operation (Saeid Safavi, Iosif Mporas)....Pages 438-444 Improving Speech-Based Emotion Recognition by Using Psychoacoustic Modeling and Analysis-by-Synthesis (Ingo Siegert, Alicia Flores Lotz, Olga Egorow, Andreas Wendemuth)....Pages 445-455 In Search of Sentence Boundaries in Spontaneous Speech (Natalia Bogdanova-Beglarian)....Pages 456-463 Investigating Acoustic Correlates of Broad and Narrow Focus Perception by Japanese Learners of English (Gábor Pintér, Oliver Jokisch, Shinobu Mizuguchi)....Pages 464-472 Language Adaptive Multilingual CTC Speech Recognition (Markus Müller, Sebastian Stüker, Alex Waibel)....Pages 473-482 Language Model Optimization for a Deep Neural Network Based Speech Recognition System for Serbian (Edvin Pakoci, Branislav Popović, Darko Pekar)....Pages 483-492 Lexico-Semantical Indices of “Deprivation – Aggression” Modality Correlation in Social Network Discourse (Rodmonga Potapova, Liliya Komalova)....Pages 493-502 Linguistic Features and Sociolinguistic Variability in Everyday Spoken Russian (Natalia Bogdanova-Beglarian, Tatiana Sherstinova, Olga Blinova, Gregory Martynenko)....Pages 503-511 Medical Speech Recognition: Reaching Parity with Humans (Erik Edwards, Wael Salloum, Greg P. Finley, James Fone, Greg Cardiff, Mark Miller et al.)....Pages 512-524 Microphone Array Post-filter in Frequency Domain for Speech Recognition Using Short-Time Log-Spectral Amplitude Estimator and Spectral Harmonic/Noise Classifier (Sergey Salishev, Ilya Klotchkov, Andrey Barabanov)....Pages 525-534 Multimodal Keyword Search for Multilingual and Mixlingual Speech Corpus (Abhimanyu Popli, Arun Kumar)....Pages 535-545 Neural Network Doc2vec in Automated Sentiment Analysis for Short Informal Texts (Natalia Maslova, Vsevolod Potapov)....Pages 546-554 Neural Network Speaker Descriptor in Speaker Diarization of Telephone Speech (Zbyněk Zajíc, Jan Zelinka, Luděk Müller)....Pages 555-563 Novel Linear Prediction Temporal Phase Based Features for Speaker Recognition (Ami Gandhi, Hemant A. Patil)....Pages 564-571 Novel Phase Encoded Mel Cepstral Features for Speaker Verification (Apeksha J. Naik, Rishabh Tak, Hemant A. Patil)....Pages 572-581 On a Way to the Computer Aided Speech Intonation Training (Boris Lobanov, Yelena Karnevskaya, Vladimir Zhitko)....Pages 582-592 Perception and Acoustic Features of Speech of Children with Autism Spectrum Disorders (Elena Lyakso, Olga Frolova, Aleksey Grigorev)....Pages 602-612 Phase Analysis and Labeling Strategies in a CNN-Based Speaker Change Detection System (Marek Hrúz, Petr Salajka)....Pages 613-622 Preparing Audio Recordings of Everyday Speech for Prosody Research: The Case of the ORD Corpus (Tatiana Sherstinova)....Pages 623-631 Recognizing Emotionally Coloured Dialogue Speech Using Speaker-Adapted DNN-CNN Bottleneck Features (Kohei Mukaihara, Sakriani Sakti, Satoshi Nakamura)....Pages 632-641 Relationship Between Perception of Cuteness in Female Voices and Their Durations (Ryohei Ohno, Masanori Morise, Tetsuro Kitahara)....Pages 642-650 Retaining Expression on De-identified Faces (Li Meng, Aruna Shenoy)....Pages 651-661 Semi-automatic Facial Key-Point Dataset Creation (Miroslav Hlaváč, Ivan Gruber, Miloš Železný, Alexey Karpov)....Pages 662-668 Song Emotion Recognition Using Music Genre Information (Athanasios Koutras)....Pages 669-679 Spanish Corpus for Sentiment Analysis Towards Brands (María Navas-Loro, Víctor Rodríguez-Doncel, Idafen Santana-Perez, Alberto Sánchez)....Pages 680-689 Speech Enhancement for Speaker Recognition Using Deep Recurrent Neural Networks (Maxim Tkachenko, Alexander Yamshinin, Nikolay Lyubimov, Mikhail Kotov, Marina Nastasenko)....Pages 690-699 Stance Classification in Texts from Blogs on the 2016 British Referendum (Vasiliki Simaki, Carita Paradis, Andreas Kerren)....Pages 700-709 The “Retrospective Commenting” Method for Longitudinal Recordings of Everyday Speech (Arto Mustajoki, Tatiana Sherstinova)....Pages 710-718 The 2016 RWTH Keyword Search System for Low-Resource Languages (Pavel Golik, Zoltán Tüske, Kazuki Irie, Eugen Beck, Ralf Schlüter, Hermann Ney)....Pages 719-730 The Effect of Morphological Factors on Sentence Boundaries in Russian Spontaneous Speech (Anton Stepikhov, Anastassia Loukina)....Pages 731-740 The Pausing Method Based on Brown Clustering and Word Embedding (Arman Kaliyev, Sergey V. Rybin, Yuri Matveev)....Pages 741-747 Unsupervised Document Classification and Topic Detection (Jaromír Novotný, Pavel Ircing)....Pages 748-756 Using a High-Speed Video Camera for Robust Audio-Visual Speech Recognition in Acoustically Noisy Conditions (Denis Ivanko, Alexey Karpov, Dmitry Ryumin, Irina Kipyatkova, Anton Saveliev, Victor Budkov et al.)....Pages 757-766 Utilizing Lipreading in Large Vocabulary Continuous Speech Recognition (Karel Paleček)....Pages 767-776 Vocal Emotion Conversion Using WSOLA and Linear Prediction (Susmitha Vekkot, Shikha Tripathi)....Pages 777-787 Voice Conversion for TTS Systems with Tuning on the Target Speaker Based on GMM (Vadim Zahariev, Elias Azarov, Alexander Petrovsky)....Pages 788-798 VoiScan: Telephone Voice Analysis for Health and Biometric Applications (Ladan Baghai-Ravary, Steve W. Beet)....Pages 799-808 Web Queries Classification Based on the Syntactical Patterns of Search Types (Alaa Mohasseb, Mohamed Bader-El-Den, Andreas Kanavos, Mihaela Cocea)....Pages 809-819 What Speech Recognition Accuracy is Needed for Video Transcripts to be a Useful Search Interface? (Yang Chao, Marie-Luce Bourguet)....Pages 820-828 Back Matter ....Pages 829-831

Similar books