Tatoeba: различия между версиями

Материал из LingvoWiki
Перейти к навигацииПерейти к поиску
Строка 39: Строка 39:
 
== Транскрипция китайского ==
 
== Транскрипция китайского ==
  
Транскрипция для кантонского китайского и путунхуа генерируется с помощью созданного Симоном Алланом приложения. Пока что предварительную версию можно загрузить по адресу [http://downloads.tatoeba.org/sinoparserd.tar.gz http://downloads.tatoeba.org/sinoparserd.tar.gz].
+
Транскрипция для кантонского китайского и путунхуа генерируется с помощью созданного Симоном Алланом приложения. Пока что предварительную версию можно загрузить по адресу [http://downloads.tatoeba.org/sinoparserd.tar.gz http://downloads.tatoeba.org/sinoparserd.tar.gz].<ref>[http://dev.tatoeba.org/eng/wall/show_message/10838#message_10838 http://dev.tatoeba.org/eng/wall/show_message/10838#message_10838]</ref>
  
Транскрипция для шанхайского китайского генерируется отдельным приложением, которое недоступно для загрузки.
+
Транскрипция для шанхайского китайского генерируется отдельным приложением, которое недоступно для загрузки. Однако для генерации шанхайской транскрипции используется та же база данных, что и в [[cjklib]].
  
 
== Источники ==
 
== Источники ==

Версия 16:55, 20 июня 2012

Tatoeba (от яп. たとえば например) — многоязычный корпус предложений, пополняемый сообществом пользователей. Все предложения из корпуса доступны для загрузки под свободной лицензией CC-BY.

История проекта

Администратор и создатель корпуса — француженка Хо Нгок Фуонг Чанг (Ho Ngoc Phuong Trang). Позже к ней присоединился второй администратор, Симон Аллан, также француз.

Основную часть корпуса до сих пор составляют предложения на английском и на японском, импортированные из корпуса Ясухито Танаки, являющегося общественным достоянием. Большая часть переводов с японского на французкий была импортирована с сайта TokiDoki.fr.

Первоначально заявлялось, что корпус Tatoeba является общественным достоянием. Однако, так как проект находится во Франции, где отсутствует возможность объявить свою работу общественным достоянием, 12 декабря 2009 года было принято решение распространять корпус по свободной лицензией Creative Commons Attribution[1].

В результате соглашения с ассоциацией Shtooka к некоторым предложениям появились аудиозаписи.

Поддерживаемые языки

На данный момент (весна 2011 года) проект поддерживает 88 языков[2], причём наибольшее количество предложений на следующих языках:

  • английский (занял первое место по количеству предложений 4 сентября 2010 года[3])
  • японский (в данный момент добавляется не очень много предложений, однако за счёт предложений из корпуса профессора Танаки язык долгое время был на первом месте по количеству предложений)
  • эсперанто
  • французский
  • немецкий

Кроме того, значительные объёмы предложений есть на следующих языках:

Среди языков есть искусственные. Самым успешным является эсперанто, но также существуют предложения на клингоне, ложбане, интерлингве, токи-поне и волапюке.

Посещаемость

В сентябре сайт посетило 22 тысячи человек, которые просмотрели на нём 369 тысяч страниц[4].

Критика

Можно отметить следующие неоднозначные моменты:

  • Языки на сайте обозначаются флагами: иногда флагом государства, где говорят на языке, иногда выдуманным флагом. Некоторые флаги спорны (например, жители США высказывались против обозначения английского флагом Великобритании; для уйгурского языка используется флаг, запрещённый в Китае).
  • Среди примеров есть достаточно большое количество одинаковых или незначительно отличающихся предложений.

Транскрипция китайского

Транскрипция для кантонского китайского и путунхуа генерируется с помощью созданного Симоном Алланом приложения. Пока что предварительную версию можно загрузить по адресу http://downloads.tatoeba.org/sinoparserd.tar.gz.[5]

Транскрипция для шанхайского китайского генерируется отдельным приложением, которое недоступно для загрузки. Однако для генерации шанхайской транскрипции используется та же база данных, что и в cjklib.

Источники

Ссылки