Автор работы: Пользователь скрыл имя, 06 Января 2014 в 16:54, реферат
В последнее время знание иностранных языков может понадобиться не только в путешествии или на приеме гостей из-за рубежа, но и в собственном доме, например, при просмотре популярных голливудских кинолент, при чтении инструкции по использованию заморских товаров или Web-страниц, которые разыскивает по всему свету неутомимый броузер. Таким образом, оказывается, что даже не покидая родных стен, мы нуждаемся в услугах переводчика. Однако необходимую помощь нам вполне может оказать домашний компьютер. Системы машинного перевода (МП) давно перестали быть диковинкой.
1. Машинный перевод…………………………………………………………………….. 3
2. Формы организации взаимодействия ЭВМ и человека при машинном переводе…. 4
3. История машинного перевода…………………………………………………………. 5
4. Качество перевода……………………………………………………………………… 8
5. Статистический машинный перевод………………………………………………….. 9
6. Компьютер на месте переводчика……………………………………………………. 10
7. Машинный перевод – это… инструмент……………………………………………... 12
8. Переводчик для офиса…………………………………………………………………. 13
9. Обзор доступных систем машинного перевода……………………………………… 19
10. Недостатки программ машинного перевода…………………………………………. 20
11. Достоинства программ – переводчиков………………………………………………. 22
12. Заключение……………………………………………………………………………… 24
13. Список используемой литературы…………………………………………………….. 26
Качество перевода
Качество перевода зависит от тематики и стиля исходного текста. Машинный перевод художественных текстов практически всегда оказывается неудовлетворительного качества. Тем не менее, для технических документов при наличии специализированных машинных словарей и некоторой настройке системы на особенности того или иного типа текстов возможно получение перевода приемлемого качества, который нуждается лишь в небольшой редакторской корректировке. Чем более формализован стиль исходного документа, тем большего качества перевода можно ожидать. Самых лучших результатов при использовании машинного перевода можно достичь для текстов, написанных в техническом (различные описания и руководства) и официально-деловом стиле.
Применение машинного перевода без настройки на тематику (или с намеренно неверной настройкой) служит предметом многочисленных бродящих по Интернету шуток. Из пространных примеров наиболее известен текст «Гуртовщики Мыши» (перевод компьютерной документации программой Poliglossum на основе медицинского, коммерческого и юридического словарей); из кратких — фраза «My cat has given birth to four kittens, two yellow, one white and one black», которую переводчик компании ПРОМТ превращает в «Моя кошка родила четырёх котят, два желтых цвета, одного белого и одного афроамериканца». Главной причиной того, почему программа перевела именно так, было то, что после слова black нужно было добавить kitten, тогда программа переведёт правильно: «Моя кошка родила четырёх котят: двух жёлтых, одного белого и одного чёрного котёнка».
Чаще всего подобные шутки связаны с тем, что программа не распознаёт контекст фразы и переводит термины дословно, к тому же не отличая собственных имён от обычных слов. Тот же переводчик ПРОМТ превращает «bra-ket notation» в «примечание Кети лифчика», «Lie algebra» — в «алгебру Лжи», «eccentricity vector» — в «вектор оригинальности», «Shawnee Smith» в «индеец племени шони Смит» и т. п.
Статистический машинный перевод
Статистический машинный перевод — это разновидность машинного перевода текста, основанная на сравнении больших объёмов языковых пар. Языковые пары — тексты, содержащие предложения на одном языке и соответствующие им предложения на втором, могут быть как вариантами написания двух предложений человеком — носителем двух языков, так и набором предложений и их переводов, выполненных человеком. Таким образом статистический машинный перевод обладает свойством «самообучения». Чем больше в распоряжении имеется языковых пар и чем точнее они соответствуют друг другу, тем лучше результат статистического машинного перевода. Под понятием "статистического машинного перевода" подразумевается общий подход к решению проблемы перевода, который основан на поиске наиболее вероятного перевода предложения с использованием данных, полученных из двуязычной совокупности текстов. В качестве примера двуязычной совокупности текстов можно назвать парламентские отчеты, которые представляют собой протоколы дебатов в парламенте. Двуязычные парламентские отчеты издаются в Канаде, Гонконге и других странах; официальные документы Европейского экономического сообщества издаются на 11 языках; а Организация объединенных наций публикует документы на нескольких языках. Как оказалось, эти материалы представляют собой бесценные ресурсы для статистического машинного перевода.
Интересные факты
Говоря о МП, следует, прежде всего, помнить, что компьютер — создание бездушное. Он не понимает языковых нюансов, намеков в тексте, того, что называется тонкой игрой слов. Да и, собственно, понять содержание текста в полной мере ему не под силу. Мышления как такового при МП не происходит: предложение расчленяется на части речи, в нем выделяются стандартные конструкции, слова и словосочетания переводятся по находящимся в памяти машины словарям. Затем переведенные части речи собираются по правилам другого языка.
Но этого, согласитесь, недостаточно для полноценного перевода. В зависимости от того или иного стиля и назначения текста одно и то же слово нередко имеет разные значения. В какой-то мере эта особенность учитывается в системах МП: предусмотрены сменные словари, иногда для каждого вида текста предусмотрен свой словарь. Если лексики одного машинного словаря не хватает и применяются несколько словарей одновременно, можно указать системе, из какого словаря нужно брать слово, если есть несколько вариантов его перевода. Наконец, программа сама может предлагать на выбор пользователю несколько вариантов перевода, и он выбирает подходящий вариант, так сказать, вручную. Могут возникнуть и проблемы с переводом слов в устойчивых словосочетаниях и фразеологизмах, но это вполне по силам компьютеру.
Наряду с установленными правилами построения предложения в каждом языке существуют и свои неписаные законы, которые иногда называются красотами языка. Например, предложение на английском языке «This is my book» дословно переводится «Это есть моя книга», и формально это будет правильным, но по-русски так не говорят. В данном случае можно сказать, что предложение «написано так, будто его составил иностранец». Конечно, приведенный пример является простейшим, и возможность исключения слова «is» очень просто отражается в программе МП. Но на практике получившийся перевод похож на текст, написанный иностранцем.
Текст также может содержать слова, которые нужно понимать в контексте образа жизни людей в конкретной стране. Например, под словом «демократ» в США подразумеваются политики, выступающие за большее вмешательство государства в экономику, а в России те, кто выступает за большую свободу рынка. Это разные понятия.
Заглавные буквы и сокращения таят в себе и другие подвохи. Когда слово начинается с большой буквы, его перевод будет начинаться тоже с большой буквы. Слово, целиком состоящее из таких букв, также будет в переводе записано заглавными. В англоязычной литературе достаточно часто встречаются внешне эффектные аббревиатуры, которые могут быть прочитаны как одно слово. Такая аббревиатура и будет переведена единым словом.
Таким образом, результаты МП часто требуют редактирования. Насколько адекватными можно считать результаты перевода на компьютере? Это определяется не только качеством системы МП, но и качеством последующего редактирования. Нередко систему МП использует в качестве подспорья специалист, которому нужно быстро перевести, например, техническую документацию. Тогда проблема корректного употребления терминов решается сама собой.
Однако МП – это такая специфическая область применения компьютеров, в проблемах которой почти каждый ощущает себя более или менее специалистом. Давайте рассмотрим, каким образом осуществляется перевод.
Во-первых, всем ясно, что чем больше словарь, тем лучше перевод, значит, первая проблема – проблема создания больших словарей для систем.
Во-вторых, ясно, что система должна переводить такие предложения: «Привет, как дела?». Значит, еще одна проблема - научить систему распознавать устойчивые обороты.
В-третьих, понятно, что предложение для перевода пишется по определенным правилам, по определенным правилам переводится, а значит, есть еще одна проблема: записать все эти правила в виде программы. Вот, собственно, и все.
Самое интересное, что эти проблемы действительно являются основными при разработке систем МП, другое дело, что методы их решения известны далеко не всем и отнюдь не так просты, как может показаться.
Системы МП семейства PROMT (PROgrammer's Machine Translation) - очень хороший объект, чтобы продемонстрировать, каким образом эти проблемы могут решаться эффективно.
Машинный перевод – это… инструмент
Всем хорошо известно, что хороший перевод текста – это не только творческая, но и достаточно трудоемкая работа. Причем даже самый хороший перевод, как правило, нуждается в редакторской правке. Что касается творческой части, то в обозримом будущем в соревновании компьютер-человек всегда победит "живой" переводчик. Однако для решения проблем, обусловленных трудоемкостью процесса перевода, системы МП могут оказаться хорошим подспорьем. Для того чтобы это лучше понять, перечислим достоинства программ машинного перевода (общие для всех систем МП вообще и систем PROMT в частности):
Коллективное использование
Однако вместо того, что бы попытаться использовать те преимущества, которые предоставляет МП, некоторые люди пытаются довести задачу до абсурда, например, пытаясь перевести поговорки, песни или стихотворения, т.е. именно то, для чего системы МП не предназначены. Другие, не удосужившись прочитать описание программы, пытаются переводить текст по медицинской тематике с подключенным банковским словарем, а затем шумно веселятся, увидев на выходе очевидную бессмыслицу. Подчас создается впечатление, что таким образом они борются с собственными комплексами и пытаются, в первую очередь, себе доказать, что они умнее компьютера. Подобные критики зачастую уподобляются известному персонажу анекдота, который подсунул ломик под бензопилу и был страшно горд, увидев плачевный результат.
Переводчик для офиса
Итак, машинный перевод уже довольно уверенно вошел в повседневную жизнь современного офиса и ни у кого не вызывает удивления. В мире существует очень много программ МП. У нас наиболее распространены системы PROMT 98 или Stylus (фирма ПРОМТ) и ПАРС (фирма «Лингвистика 93»). PROMT 98 (Stylus) предназначена для профессионального перевода больших объемов информации, но ее лицензионная копия достаточно дорога. Что же касается использования пиратских копий, то они, как правило, имеют всего один-два словаря с относительно небольшим количеством слов. В лицензионной же копии есть широкий выбор специализированных словарей. Таким образом, использование пиратских копий не только неэтично с моральной и правовой точек зрения, но и не позволяет получить качественный перевод многих текстов.
Информация о работе Системы машинного перевода. Достоинства и недостатки