MoChA splits sequences into chunks for efficient, online attention.
problem Efficiently decoding sequence-to-sequence models with soft attention.
method Adaptive chunking of input sequences for soft attention computation.
result MoChA models achieve state-of-the-art performance in online speech recognition and document summarization.