Tatodetect: различия между версиями

Версия 19:19, 31 июля 2012

Tatodetect — программа для определения языка текста на основании n-граммных моделей языка, использующаяся на проекте Tatoeba. Автор — автор::Аллан Симон (Simon Allan). Программа написана на языке язык программирования::C++ (с использованием возможностей нового стандарта C++11) и работает как сервер, к которому обращаются клиенты. Распространяется по лицензии лицензия::AGPL 3.

Проверена работоспособность на в ОС GNU/платформа::Linux (дистрибутивы Ubuntu и Debian). Программа использует библиотеки CppCMS, Boost.Locale, CppDB и sqlite3.

Словарь содержит частые n-граммы для всех рассматриваемых языков. Вначале программа пробует определить язык по пентаграммам, т.е. по сочетаниям пяти символов. Если в словаре недостаточно пентаграмм, производится проверка с использованием тетраграмм, триграмм и биграмм. Это позволяет эффективно работать как с европейскими языками, так и с восточноазиатскими.

Версия 14:54, 31 июля 2012 (просмотреть исходный код) Fujhi (обсуждение \| вклад) м ← Предыдущая правка		Версия 19:19, 31 июля 2012 (просмотреть исходный код) Bhudh (обсуждение \| вклад) м (Ордхограбхия имени ))) Следующая правка →
Строка 1:		Строка 1:
−	'''Tatodetect''' — программа для [[функция::определение языка\|определения языка]] текста на основании [[n-граммы\|n-граммных]] [[Модель языка\|моделей языка]], ~~автор~~ — [[автор::~~Аллана Симона~~]] (Simon Allan)~~, использующаяся на проекте [[Tatoeba]]~~. Программа написана на языке [[язык программирования::C++]] (с использованием возможностей нового стандарта C++11) и работает как сервер, к которому обращаются клиенты. Распространяется по лицензии [[лицензия::AGPL]] 3.	+	'''Tatodetect''' — программа для [[функция::определение языка\|определения языка]] текста на основании [[n-граммы\|n-граммных]] [[Модель языка\|моделей языка]], использующаяся на проекте [[Tatoeba]]. Автор — [[автор::Аллан Симон]] (Simon Allan). Программа написана на языке [[язык программирования::C++]] (с использованием возможностей нового стандарта C++11) и работает как сервер, к которому обращаются клиенты. Распространяется по лицензии [[лицензия::AGPL]] 3.

	Проверена работоспособность на в ОС GNU/[[платформа::Linux]] (дистрибутивы Ubuntu и Debian). Программа использует библиотеки [http://cppcms.com/wikipp/en/page/main CppCMS], [http://www.boost.org/doc/libs/1_50_0/libs/locale/doc/html/index.html Boost.Locale], [http://cppcms.com/sql/cppdb/ CppDB] и [http://sqlite.org/ sqlite3].		Проверена работоспособность на в ОС GNU/[[платформа::Linux]] (дистрибутивы Ubuntu и Debian). Программа использует библиотеки [http://cppcms.com/wikipp/en/page/main CppCMS], [http://www.boost.org/doc/libs/1_50_0/libs/locale/doc/html/index.html Boost.Locale], [http://cppcms.com/sql/cppdb/ CppDB] и [http://sqlite.org/ sqlite3].

Tatodetect: различия между версиями

Версия 19:19, 31 июля 2012

Навигация

Действия на странице

Действия на странице

Персональные инструменты

Поиск

Навигация

Инструменты