Читаем Профессия: переводчик полностью

Профессия: переводчик

свинец (лот / грузило / проводник) всасывает (впитывает / абсорбирует / амортизирует / поглощает) излучение (радиацию) или

излучение (радиация) впитывается (абсорбируется / амортизируется / поглощается) свинцом (лотом / грузилом / проводником).

Так в общих чертах работает переводящий автомат второго уровня, построенный по схеме синтактико-семан-тического трансфера. Такой автомат строится для определенной пары языков и, как вы сами можете судить, использует алгоритмические процедуры анализа и синтеза на основе синтаксической и семантической информации.

Как уже говорилось, большинство коммерческих переводящих систем работает на этом принципе. В некоторых из них синтактико-семантическая информация более полная и алгоритмы анализа более тонкие, чем в других. Такие "электронные переводчики" переводят чуть лучше, чем их более примитивно устроенные "братья по классу", но в любом случае без привлечения фоновой информации они не в состоянии конкурировать с человеком.

Кроме схемы трансфера в переводящих системах второго уровня применяется также так называемый язык-посредник. Язык-посредник (interlingua, pivot language) -это некий универсальный код, с помощью которого можно единым образом выразить грамматическую и семантическую информацию, содержащуюся в тексте на любом языке.

Задача переводящего автомата, применяющего язык-посредник, будет состоять в том, чтобы преобразовать текст на одном языке в форму языка-посредника, а затем, используя средства другого языка, генерировать выходной текст из форматов языка-посредника.

Привлекательность этой идеи достаточно очевидна, но ее практическое воплощение оказалось очень непростым. И хотя некоторые зарубежные системы в своих рекламных буклетах пишут об использовании единого языка-посредника для автоматического перевода с разных языков, это, насколько мне известно, скорее рекламный прием, чем действительное положение вещей.

Описать в едином формате даже структурно подобные языки достаточно сложная задача сама по себе, не говоря уже о ее алгоритмической реализации. Поэтому в настоящее время, несмотря на обширный теоретический материал, едва ли можно говорить о коммерческих системах машинного перевода, работающих на принципе языка-посредника.

Такова ситуация с практической реализацией систем второго уровня.

Что же касается систем третьего уровня, то, как уже говорилось выше, экспериментальные системы такого типы разработаны лишь для некоторых очень ограниченных тематических сфер.

В этих системах окончательное решение о выборе переводного эквивалента принимается "блоком принятия решений" на основе так называемой базы знаний - формального описания фрагмента реального мира (его составляющих и отношений между ними). Сложность концептуальной и программной реализации таких систем, я думаю, очевидна.

Особое место в теории и практике машинного перевода занимают системы, основанные на статистических моделях переводных соответствий.

Согласно статистическому подходу к конструированию систем автоматического перевода, любое слово одного языка может быть переведено любым словом другого, только с разной вероятностью.

Задача переводящего автомата, работающего на вероятностном принципе достаточно проста.

На первом этапе, называемом этапом обучения, этот

автомат должен сравнивать оригинальные тексты и выполненные человеком переводы этих текстов и регистрировать величины вероятности разных переводных эквивалентов.

Параллельно на этапе обучения автомата в зависимости от используемой модели регистрируется либо порядок слов в исходном и переводном предложении, либо вероятность перевода двух-, трехсловных словосочетаний.

В итоге на основании анализа параллельных двуязычных текстов автомат после этапа обучения составляет словарь наиболее вероятных эквивалентов.

После этого следует этап перевода, когда автомат, пользуясь составленным таким образом вероятностным словарем, переводит новый текст. В случае неполноты словаря обучение автомата продолжают на новом массиве параллельных текстов.

Такова общая идея. Конечно, она представлена упрощенно - в действительности вычисление вероятности переводных эквивалентов производится по сложным многопараметрическим формулам, учитывающим текстовое окружение исходного и переводного слова.

Идея статистического машинного перевода появилась еще в пятидесятые годы, но сейчас она снова становится популярной. Возрождение идеи статистического машинного перевода можно объяснить следующим:

• Огромными технологическими возможностями современных компьютеров (память, быстродействие).

• Наличием больших объемов двуязычных параллельных текстов на машинных носителях.

• Отсутствием стройной и непротиворечивой теории перевода, которая смогла бы выдержать проверку на компьютерной модели.

Статистические модели перевода активно разрабатываются в США и в некоторых других странах, и, на мой взгляд, у них большое будущее.

Учитывая огромное число факторов, определяющих качество перевода (значительная часть которых либо не

Перейти на страницу: