Mixed-Lingual Pre-training for Cross-lingual Summarization

Ruochen Xu; Chenguang Zhu; Yu Shi; Michael Zeng; Xuedong Huang

2020 AACL AACL 2020

Mixed-Lingual Pre-training for Cross-lingual Summarization

Abstract

AbstractCross-lingual Summarization (CLS) aims at producing a summary in the target language for an article in the source language. Traditional solutions employ a two-step approach, i.e. translate -> summarize or summarize -> translate. Recently, end-to-end models have achieved better results, but these approaches are mostly limited by their dependence on large-scale labeled data. We propose a solution based on mixed-lingual pre-training that leverages both cross-lingual tasks such as translation and monolingual tasks like masked language models. Thus, our model can leverage the massive monolingual data to enhance its modeling of language. Moreover, the architecture has no task-specific components, which saves memory and increases optimization efficiency. We show in experiments that this pre-training scheme can effectively boost the performance of cross-lingual summarization. In NCLS dataset, our model achieves an improvement of 2.82 (English to Chinese) and 1.15 (Chinese to English) ROUGE-1 scores over state-of-the-art results.

🚀 Conference Pioneer — AACL 2020

🧭 Keyword Pioneer — cross-lingual summarization

🐣 Hot Topic Early Bird — multilingual model

🐝 Cross-Pollinator — Artificial Intelligence, Computer Science, Computer Vision, Data Science & Analytics, Deep Learning, Healthcare & Medicine, Interdisciplinary, Knowledge & Reasoning, Machine Learning, Mathematics & Optimization, Natural Language Processing, Reinforcement Learning, Speech & Audio

Authors

Ruochen Xu , Chenguang Zhu , Yu Shi , Michael Zeng , Xuedong Huang

Topics

Natural Language Processing > Generation > Summarization Natural Language Processing > Resources & Methods > Multilingual NLP

Keywords

machine translation language model multilingual model cross-lingual summarization mixed-lingual pre-training

Download PDF

Related papers

Can Monolingual Pretrained Models Help Cross-Lingual Classification? 2020

Text Simplification with Reinforcement Learning Using Supervised Rewards on Grammaticality, Meaning Preservation, and Simplicity 2020

ISA: An Intelligent Shopping Assistant 2020

Social Media Medical Concept Normalization using RoBERTa in Ontology Enriched Text Similarity Framework 2020

Overcoming Resistance: The Normalization of an Amazonian Tribal Language 2020