diff --git a/datasets/README.md b/datasets/README.md index 1d9e522..3bc8ff5 100644 --- a/datasets/README.md +++ b/datasets/README.md @@ -1,5 +1,8 @@ # Датасет Silero-VAD +Датасет создан при поддержке Фонда содействия инновациям в рамках федерального проекта «Искусственный +интеллект» национальной программы «Цифровая экономика Российской Федерации». + По ссылкам ниже представлены `.feather` файлы, содержащие размеченные с помощью Silero VAD открытые наборы аудиоданных, а также короткое описание каждого набора данных с примерами загрузки. `.feather` файлы можно открыть с помощью библиотеки `pandas`: ```python3 import pandas as pd @@ -14,13 +17,14 @@ dataframe = pd.read_feather(PATH_TO_FEATHER_FILE) **Все данные размечены при временной дискретизации в ~30 миллисекунд (`num_samples` - 512)** -| Название | Число часов | Число язков | Ссылка | Лицензия | -|----------------------|-------------|-------------|--------|----------| -| **Bible.is** | 53,138 | 1,596 | [URL](https://live.bible.is/) | [Уникальная](https://live.bible.is/terms) | -| **globalrecordings.net** | 9,743 | 6,171* | [URL](https://globalrecordings.net/en) | CC BY-NC-SA 4.0 | -| **VoxLingua107** | 6,628 | 107 | [URL](https://bark.phon.ioc.ee/voxlingua107/) | CC BY 4.0 | -| **Common Voice** | 30,329 | 120 | [URL](https://commonvoice.mozilla.org/en/datasets) | CC0 | -| **MLS** | 50,709 | 8 | [URL](https://www.openslr.org/94/) | CC BY 4.0 | +| Название | Число часов | Число языков | Ссылка | Лицензия | md5sum | +|----------------------|-------------|-------------|--------|----------|----------| +| **Bible.is** | 53,138 | 1,596 | [URL](https://live.bible.is/) | [Уникальная](https://live.bible.is/terms) | ea404eeaf2cd283b8223f63002be11f9 | +| **globalrecordings.net** | 9,743 | 6,171[^1] | [URL](https://globalrecordings.net/en) | CC BY-NC-SA 4.0 | 3c5c0f31b0abd9fe94ddbe8b1e2eb326 | +| **VoxLingua107** | 6,628 | 107 | [URL](https://bark.phon.ioc.ee/voxlingua107/) | CC BY 4.0 | 5dfef33b4d091b6d399cfaf3d05f2140 | +| **Common Voice** | 30,329 | 120 | [URL](https://commonvoice.mozilla.org/en/datasets) | CC0 | 5e30a85126adf74a5fd1496e6ac8695d | +| **MLS** | 50,709 | 8 | [URL](https://www.openslr.org/94/) | CC BY 4.0 | a339d0e94bdf41bba3c003756254ac4e | +| **Итого** | **150,547** | **6,171+** | | | | ## Bible.is @@ -32,7 +36,7 @@ dataframe = pd.read_feather(PATH_TO_FEATHER_FILE) [Ссылка на `.feather` файл с разметкой](https://models.silero.ai/vad_datasets/globalrecordings.feather) -- Колонка `folder_link` содержит ссылки на скачивание `.zip` архива для конкретного языка. Внимание! Эти ссылки дублируются, они уникальны для каждого языка, а не каждого аудио. +- Колонка `folder_link` содержит ссылки на скачивание `.zip` архива для конкретного языка. Внимание! Ссылки на архивы дублируются, т.к каждый архив может содержать множество аудио. - Колонка `audio_path` содержит пути до конкретного аудио после распаковки соответствующего архива из колонки `folder_link` ``Количество уникальных ISO кодов данного датасета не совпадает с фактическим количеством представленных языков, т.к некоторые близкие языки могут кодироваться одним и тем же ISO кодом.`` @@ -41,7 +45,7 @@ dataframe = pd.read_feather(PATH_TO_FEATHER_FILE) [Ссылка на `.feather` файл с разметкой](https://models.silero.ai/vad_datasets/VoxLingua107.feather) -- Колонка `folder_link` содержит ссылки на скачивание `.zip` архива для конкретного языка. Внимание! Эти ссылки дублируются, они уникальны для каждого языка, а не каждого аудио. +- Колонка `folder_link` содержит ссылки на скачивание `.zip` архива для конкретного языка. Внимание! Ссылки на архивы дублируются, т.к каждый архив может содержать множество аудио. - Колонка `audio_path` содержит пути до конкретного аудио после распаковки соответствующего архива из колонки `folder_link` ## Common Voice @@ -56,7 +60,7 @@ dataframe = pd.read_feather(PATH_TO_FEATHER_FILE) [Ссылка на `.feather` файл с разметкой](https://models.silero.ai/vad_datasets/MLS.feather) -- Колонка `folder_link` содержит ссылки на скачивание `.zip` архива для конкретного языка. Внимание! Эти ссылки дублируются, они уникальны для каждого языка, а не каждого аудио. +- Колонка `folder_link` содержит ссылки на скачивание `.zip` архива для конкретного языка. Внимание! Ссылки на архивы дублируются, т.к каждый архив может содержать множество аудио. - Колонка `audio_path` содержит пути до конкретного аудио после распаковки соответствующего архива из колонки `folder_link` ## Лицензия @@ -76,3 +80,5 @@ dataframe = pd.read_feather(PATH_TO_FEATHER_FILE) email = {hello@silero.ai} } ``` + +[^1]: ``Количество уникальных ISO кодов данного датасета не совпадает с фактическим количеством представленных языков, т.к некоторые близкие языки могут кодироваться одним и тем же ISO кодом.``