Tatoeba: различия между версиями
Demetrius (обсуждение | вклад) м |
Demetrius (обсуждение | вклад) м (обновил статистику) |
||
Строка 11: | Строка 11: | ||
== Поддерживаемые языки == | == Поддерживаемые языки == | ||
− | На данный момент ( | + | На данный момент (весна 2011 года) проект поддерживает 88 языков<ref>[http://tatoeba.org/eng/stats/sentences_by_language http://tatoeba.org/eng/stats/sentences_by_language / Дата доступа: 28 марта 2011 года]</ref>, причём наибольшее количество предложений на следующих языках: |
* [[Английский язык]] (занял первое место по количеству предложений 4 сентября 2010 года<ref>[http://tatoeba.org/eng/wall/show_message/2662#message_2662 Сообщение на стене]</ref>) | * [[Английский язык]] (занял первое место по количеству предложений 4 сентября 2010 года<ref>[http://tatoeba.org/eng/wall/show_message/2662#message_2662 Сообщение на стене]</ref>) | ||
* [[Японский язык]] (в данный момент добавляется не очень много предложений, однако за счёт предложений из корпуса профессора Танаки язык долгое время был на первом месте по количеству предложений) | * [[Японский язык]] (в данный момент добавляется не очень много предложений, однако за счёт предложений из корпуса профессора Танаки язык долгое время был на первом месте по количеству предложений) | ||
+ | * [[Эсперанто]] | ||
* [[Французкий язык]] | * [[Французкий язык]] | ||
− | |||
* [[Немецкий язык]] | * [[Немецкий язык]] | ||
− | + | Кроме того, значительные объёмы предлложений есть на следующих языках: | |
+ | * [[Испанский язык|испанский]], [[Польский язык|польский]] (более 30 000) | ||
+ | * [[Китайский язык]] ([[путунхуа]]), [[Русский язык|русский]] (более 25 000); | ||
+ | * [[Итальянский язык|итальянский]], [[Голландский язык|голландский]], [[Украинский язык|украинский]] (более 15 000). | ||
+ | * [[Венгерский язык|венгерский]], [[иврит]], [[фарси]] (более 10 000) | ||
+ | * [[Португальский язык|португальский]], [[Арабский язык|арабский]] (литературный), [[Исландский язык|исландский]], [[Турецкий язык|турецкий]], [[Нижнесаксонский язык|нижнесаксонский]], [[Датский язык|датский]] (более 5 000 предложений) | ||
+ | * [[Болгарский язык|болгарский]], [[Уйгурский язык|уйгурский]], [[хинди]], [[Шанхайский китайский язык|шанхайский китайский]], [[Вьетнамский язык|вьетнамский]] (более 3 000) | ||
+ | * [[Белорусский язык|белорусский]], [[клингон]], [[ложбан]] (более 2 000) | ||
− | + | Среди языков есть искусственные. Самым успешным является [[эсперанто]], но также существуют предложения на [[клингон]]е, [[ложбан]]е, [[Интерлингва|интерлингве]], [[Токи-пона|токи-поне]] и [[волапюк]]е. | |
== Посещаемость == | == Посещаемость == | ||
В сентябре сайт посетило 22 тысячи человек, которые просмотрели на нём 369 тысяч страниц<ref>[http://blog.tatoeba.org/2010/10/some-stats.html Tatoeba Project Blog: Some stats (14 октября 2010)]</ref>. | В сентябре сайт посетило 22 тысячи человек, которые просмотрели на нём 369 тысяч страниц<ref>[http://blog.tatoeba.org/2010/10/some-stats.html Tatoeba Project Blog: Some stats (14 октября 2010)]</ref>. | ||
+ | |||
+ | == Критика == | ||
+ | Можно отметить следующие неоднозначные моменты: | ||
+ | * Языки на сайте обозначаются флагами: иногда флагом государства, где говорят на языке, иногда выдуманным флагом. Некоторые флаги спорны (например, жители США высказывались против обозначения английского флагом Великобритании; для уйгурского языка используется флаг, запрещённый в Китае). | ||
+ | * Среди примеров есть достаточно большое количество одинаковых или незначительно отличающихся предложений. | ||
+ | |||
== Источники == | == Источники == |
Версия 17:21, 28 апреля 2011
Tatoeba (от яп. たとえば например) — многоязычный корпус предложений, пополняемый сообществом пользователей. Все предложения из корпуса доступны для загрузки под свободной лицензией CC-BY.
История проекта
Администратор и создатель корпуса — француженка Хо Нгок Фуонг Чанг (Ho Ngoc Phuong Trang). Позже к ней присоединился второй администратор, Симон Аллан, также француз.
Основную часть корпуса до сих пор составляют предложения на английском и на японском, импортированные из корпуса Ясухито Танаки, являющегося общественным достоянием. Большая часть переводов с японского на французкий была импортирована с сайта TokiDoki.fr.
Первоначально заявлялось, что корпус Tatoeba является общественным достоянием. Однако, так как проект находится во Франции, где отсутствует возможность объявить свою работу общественным достоянием, 12 декабря 2009 года было принято решение распространять корпус по свободной лицензией Creative Commons Attribution[1].
В результате соглашения с ассоциацией Shtooka к некоторым предложениям появились аудиозаписи.
Поддерживаемые языки
На данный момент (весна 2011 года) проект поддерживает 88 языков[2], причём наибольшее количество предложений на следующих языках:
- Английский язык (занял первое место по количеству предложений 4 сентября 2010 года[3])
- Японский язык (в данный момент добавляется не очень много предложений, однако за счёт предложений из корпуса профессора Танаки язык долгое время был на первом месте по количеству предложений)
- Эсперанто
- Французкий язык
- Немецкий язык
Кроме того, значительные объёмы предлложений есть на следующих языках:
- испанский, польский (более 30 000)
- Китайский язык (путунхуа), русский (более 25 000);
- итальянский, голландский, украинский (более 15 000).
- венгерский, иврит, фарси (более 10 000)
- португальский, арабский (литературный), исландский, турецкий, нижнесаксонский, датский (более 5 000 предложений)
- болгарский, уйгурский, хинди, шанхайский китайский, вьетнамский (более 3 000)
- белорусский, клингон, ложбан (более 2 000)
Среди языков есть искусственные. Самым успешным является эсперанто, но также существуют предложения на клингоне, ложбане, интерлингве, токи-поне и волапюке.
Посещаемость
В сентябре сайт посетило 22 тысячи человек, которые просмотрели на нём 369 тысяч страниц[4].
Критика
Можно отметить следующие неоднозначные моменты:
- Языки на сайте обозначаются флагами: иногда флагом государства, где говорят на языке, иногда выдуманным флагом. Некоторые флаги спорны (например, жители США высказывались против обозначения английского флагом Великобритании; для уйгурского языка используется флаг, запрещённый в Китае).
- Среди примеров есть достаточно большое количество одинаковых или незначительно отличающихся предложений.