MirasAI
MA
Founder & Director · MirasAI LLC Fulbright PhD candidate, Computational Linguistics — Indiana University Bloomington

Meesum Alam

Building the open speech and text data that 70+ languages of Pakistan never had — then publishing it openly so anyone can build on it.

Email meesum@mirasai.net Datasets on Mozilla Data Collective ↗
Fig. 1 — Record to date
$0K+
research funding raised
0
languages, one funded corpus
0
datasets published
0
consultants coordinated

Most South Asian languages don't exist in the data modern AI is built on.

Meesum Alam founded MirasAI to change that — commissioning, curating, and publishing open speech and text datasets for Punjabi, Saraiki, Pashto, Balochi, Hazargi, Khowar, Brahui, and dozens more.

He is a PhD candidate in computational linguistics at Indiana University Bloomington on a Fulbright scholarship, and Regional Researcher for South Asia at Mozilla Data Collective. His largest project — a 39-language Pakistani speech corpus built with 75 language consultants — was published at LREC 2026, the field's leading language-resources venue.

Funding composition
Mozilla Foundation · $227K89%
Voice AI initiative · hours directed
Fig. 2 — Appointments & principal roles

Four concurrent mandates, one problem.

Mozilla Foundation$227K

Principal Investigator — Common Voice Pakistan

Led a nationwide speech corpus effort across 39 languages, now peer-reviewed and published at LREC 2026.

MirasAI LLC858 hrs

Voice AI Dataset Initiative

Directed 500-hr Urdu TTS, 200-hr Saraiki TTS, 100-hr Sindhi multimodal, and 60-hr five-language datasets.

Mozilla Data Collective60+ langs

Regional Researcher, South Asia

Sources, quality-controls, and publishes open datasets spanning 60+ languages on the leading open-data platform.

Fulbright · IU BloomingtonPhD

Computational Linguistics

Researching Saraiki morphology and grammar while building the computational tools to document it.

Fig. 3 — Peer-reviewed publication
Published · LREC 2026

Common Voice for Pakistan: An Open Speech Corpus for 39 Low-Resource Languages

A one-year, Mozilla-funded effort to build a community-driven speech corpus spanning Pakistan's Indo-Aryan, Iranian, Dardic, Turkic, and isolate language families — from Balochistan and Sindh up through Gilgit-Baltistan and Kashmir.

Alam, M. & Tyers, F. M. (2026). Common Voice for Pakistan: Developing an Open Speech Corpus for Low-Resource Pakistani Languages.
Proceedings of the 15th Language Resources and Evaluation Conference (LREC 2026), pp. 3355–3359. ELRA. · Released CC0.

Corpus at a glance
493.6 hrs validated92.7%
532.6hours recorded
139,000+sentences
1,058speakers
39languages
Fig. 4 — Technical & linguistic capabilities

Methods & tooling

PythonPyTorchASR / TTS dataset design Audio QC & speaker validationCorpus annotation Universal DependenciesGrant & proposal writing Dataset licensing

Working languages

SaraikiPunjabiUrdu HindiEnglish

Work together

Commissioned datasets, research collaboration, and language-technology consulting across South Asia.