ラベル translation の投稿を表示しています。 すべての投稿を表示
ラベル translation の投稿を表示しています。 すべての投稿を表示

2012年5月15日火曜日

Moses Core

ちょっと気になるニュースが。

EUが資金援助、自作の機械翻訳システムが作れるオープンソースプロジェクト「MosesCore」が本格スタート

MosesそのものはオープンソースのSMTエンジンとしてよく知られているので、特にどうということはないのですが、この記事だけだといまいち何なのか分からないですね。Moses Coreのウェブサイト(リンク)を見ると、下部にこうした記述があります。
"MosesCore is supported by the European Commission Grant Number 288487 under the 7th Framework Programme"
まず、このMoses Coreを支援している"7th Framework Programme"は、リスボン戦略(リン12)という知識経済の振興を目的としたEUの経済戦略に基づいて進められているようです。これ自体、読んでいてなかなか面白いですね。

プログラムの詳細はEUの日本語サイト(リンク)にも掲載されています。Moses Coreについて特に言及はありませんが、PDFを読んでいくと、ICTの推進という辺りで微妙に気になる表現が。
-ソフトウェア、グリッド、セキュリティ、信頼性-ダイナミックで順応性・信頼性も高 いソフトウェアと各種サービス、また、新種の処理アーキテクチャ(ユーティリティとして提供されるものも含む)
この手の官僚ドキュメントの読み方に通暁しているわけでもないのですが、色んな情報を仕入れた上で読むと、あー、まあ、そういうことなのかなあ、という部分はあります。

ちなみに、"European Commission Grant Number 288487"でググると北京で開催されたTAUSの記事も出てきます(リンク)。ウェブサイトよりもこっちの方が分かりやすいですね。Mosesに関しては、ダウンロードして遊んでみて放置していたのでGUIで使えるようになると助かるのですが・・・

2012年5月14日月曜日

巨人の肩の上から - TAUSと日本

過去に自分の書いた色々な文章を整理していたところ、TAUSに初めて参加したときのものが出てきました。我ながら多少気の利いたことを書いていたので、再構成してアップします。

先日のTAUS Tokyoでも壮大なヴィジョンが提示されていましたが、2年前のもっとシンプルなものでした。動画がyoutubeに上がっています。


音声抜きで絵を見ているだけでも何となく理解できると思いますが、ここでは、翻訳という行為を、異言語間での情報の集積と伝播の過程のなかで継続して用いられてきた技術として捉えています。

その上で、雲(クラウド)に届こうというバベルの塔や、世界最古の対訳コーパス(翻訳メモリ)としてのロゼッタストーンなど、よく知られたものを現在の文脈で解釈しています。特に、翻訳メモリなどは馴染みのある人にとっても最近登場してきたものとして受け取られがちですが、その発想は文字が発明されたときからあったわけですね。

そういえば、翻訳メモリを開発したのは、ロゼッタストーンを解読したシャンポリオンの子孫だという噂を聞いたことがあります。真偽は分かりませんが、面白い話です。ロゼッタストーンを対訳コーパスとして捉えると、翻訳メモリの開発者は、血縁的な意味での子孫というよりは、シャンポリオンの仕事を受け継いだというのが正しいのかも知れません。

「巨人の肩の上に立つ(Stand on the shoulders of giants)」という言葉を思い出します。特にアカデミックな世界ではよく使われると思いますが、先人の築いてきた知識の上に新たな知見を加えていく姿勢を指したものです。動画を見ると、TAUSのこのヴィジョン自体が、シナイ半島から発するヨーロッパ的な文化と歴史の上に築かれているものであることがよく分かります。もっとも、エウロペは巨人ではなくて女神ですが。いや、デカイのかも知れませんが。

今年のTAUS Tokyoでは、このヴィジョンも更にグレードアップしていました。詳細はいずれ公開されたときにでも、と思いますが「人権としての翻訳」など、やはりヨーロッパ(というか、EU)に根を持つ発想ということは改めて思いました。

日本でこうしたものを作れるのかという点では、文明論的な話にもなるのでわたしには少々手に余るところもあるのですが、こうした形で、翻訳とはいかなる意味を持つものかを問い直すことは非常に重要なことと思います。311以降の日本は、どうも現実が勝ちすぎるきらいがあって、そろそろ、そこから離れた思考というものも必要な時期だと思います。

2012年5月7日月曜日

言語による論述スタイルの違いについて

今年のGWは引きこもって読書と考えていたが、最終的には1500ページぐらいだった。

読む本にもよるのでこれで多い少ないはあまり意味がないけれども、多読しているよりも一冊をちゃんと読んだ方がいいような気もする。ただ、一冊を「ちゃんと読む」というのは難しくて、関連する本を並べながら共通する部分を取り出して差分を整理していく方が、少なくとも自分にとっては効率が良い。また、本というものは常に他の本との関わりのなかに存在しているので、一冊だけ読むというのはそもそも、あまり意味のない話であったりもする。

読もうと思っていたジャック・ドンズロの『都市が壊れるとき』や、構成主義の勉強でピアジェの本など読もうと思っていたが、進まなかった。どうもフランス圏の本は読みにくい気がする。表現やレトリックの問題もあるかも知れないが、これはフランス語特有の記述の方式もあるんじゃないかと思ったりもする。



カプランによる、各言語のコミュニケーションや記述のスタイルをまとめたこの図はけっこう面白い(なぜか、ずっとフーコーだと思い込んでいた)。それぞれの言語には複数の言語が含まれていて、例えばEnglishにはドイツ語、オランダ語、ノルウェー語、デンマーク語、スウェーデン語などが含まれる。これらの特徴をまとめると、

  • 英語:テーマから話が脱線したり、主題から離れることはなく直線的に進む
  • セム:テーマと、それに対置される考えの間を行ったり来たりする
  • 東洋:直接的でなく、テーマの周りを様々な視点から語る(日本語、中国語など)
  • ロマンス:しばしばテーマから脱線するが、脱線もまた豊かさのなかに含まれるため問題ない(フランス、イタリア、スペイン、ルーマニアなど)
  • ロシア:ロマンス語と同じようにしばしばテーマから脱線するが、テーマに対置される考えも含む

フランス人やイタリア人の話に脱線が多い、というのは話をしていると確かによく感じることで、笑える点ではある。むしろ、あいつらほぼ脱線だなと。

実際のところ、この分類はインド・ヨーロッパ語族の上での分け方に合わせた方が分かりやすい気がするが、これらの言語の成立の流れ、ギリシャ語からロマンス語(ラテン)とロシア(キリル系)に分かれ、ロマンス語から英語へと言語が発展していった流れを考えると納得できるものがある。

文字の上でもアルファベットとキリルで分岐している。宗教上のことも、ざっくり分けるとカトリックと正教徒とで分かれるのではないかと思う。ルーマニアは正教徒なので、言語と一対一で対応しているわけではないけれども。

翻訳について考えるときにも、この論述スタイルは考慮しておく必要がある。多くはドキュメントの構成の段階で決まるものだが、この分け方でいえば、テクニカルコミュニケーションというのは英語のスタイルに近いものになっている。単線的で、誤解を産まない表現が求められる。

日本語で書いたPR文などは、翻訳しても使えないというのが業界では定説になっていると思うが、恐らくこの記述スタイルの問題がある。ひとまず英語に訳した上で再構成するという手段が取られることが多いが、多くのサンプルで比較してみると、上記のグルグルをまっすぐな↓に近づけている部分があるのではないかと思う。

2012年4月22日日曜日

Studio2009はAK-47か

業界のデファクト・スタンダードのツールであるTrados。Studio 2009になってからインターフェースと設計思想ががらりと変わったせいで拒絶感を示すユーザがいました。未だに使っていない人も多くいます。

自分もあまり好きではなかったのですが、理由をよくよく考えてみると、作成者の想定した使い方しかできない(少なくともはじめはそのように感じられる)ことが根本にある気がします。

プロジェクト管理の視点のみで語ると、2007までのTradosは、洗練はされていないものの、WorkbenchとTagEditorの個別の機能を組み合わせると色々なことができました。「色々なこと」のなかには、試行錯誤できるパターンの数やバッドノウハウも含んでいます。結果として、受け取るファイルのデータ構造やテキスト配置が整理されていなくても、系全体としては何となく処理できてしまう特性がありました。

AK-47が過酷な環境でも動作するという話(リンク)は、これに近いものがあります。ゆとり、疎結合、遊び(可動範囲)といった領域をとっておくと変化へ対応できる可能性が増える。逆に系を構成する部品たちの精度と緊密性が高まると、意外と簡単な問題で躓いたりする。

この意味で、Studio2009を単独で見るとイノベーションのジレンマに陥っているように見えるのですが、TMSなどにより原文データが整理されたものになれば、一概にそう言えるものでもないのですね。いつまでもジャングルでゲリラ戦をやってるわけにもいかんので、別の戦場で戦いましょうというのが開発側の基本的な考えです。

しかし、より重要なのは、Studioが連携を図るTMSなどのシステムは、特定の課題を解決するためのツールとは異なり、多くの場合においてローカリゼーション・プロセスのリエンジニアリングを意味するものであるという点でしょう。

2012年4月18日水曜日

機械翻訳と茶色抜きのm&m's

昨日の続き。用語集がないことは、いったい何が問題なのか?

単に翻訳がし辛い(人間が訳すにしても、色々な固有名は難しい)というのはありますが、定訳の用語集がないということは、ウェブに掲載された情報と、実際のイベント会場やその周辺とで、同じものに対して異なる名前がつけられる可能性があるということです。

今回問題になったのはウェブの翻訳でしたが、これはお客さんを集めてくる導線の一つです。言ってみれば、ウェブの情報を見た人をどのように現場に連れてくるかという設計が抜け落ちているということですね。本当の問題はこちらで、機械翻訳をそのまま使ってしまったというのは、あくまで表に出てきた問題の一部に過ぎません。

用語集一つで大げさでしょうか。ヴァン・ヘイレンがライブハウスと締結した契約書の付帯事項には、「茶色の粒を抜いたm&m'sを準備すること」を要求する文言が入っていました。



ステージセットが巨大化し電力や安全面での配慮が不可欠となっており、契約書が長大なものになっていたため、きちんと全文読み込まれて対策がなされているかのチェックポイントとして使用されていたということです。そして、この一見つまらない項目が守られていないようなら、全面的に再点検をさせる。そうすると、どこかで問題が発見されたそうあ。もう少し詳しい話は、ここ(リンク)とか英文wikipedia(リンク)などで。

翻訳に戻ると、しばしば巨大なスタイルガイドを運用しているクライアントに遭遇することがあります。「本当に全部守るんですか」と尋ねると、「重要なポイント以外は全てをきちんと守る必要はない」という回答が来ることが経験的には多かったです。恐らくこれは茶色のm&m'sとして機能することを期待しているのではないかと思います。本当に全部守れという場合もありましたが。

「重要なポイント」がどこか分かるようなら信頼に足るし、そうでなければ要注意。分かりやすいですね。腕の良い翻訳者の方は、大抵はスタイルもいい具合に合わせてきます。とりわけ多言語プロジェクト回す際に、スタイルを守れているかという点は、茶色のm&m'sだと考えています。

この点は、機械翻訳の運用について考える際にも重要な点です。

機械翻訳があまり使えないというのに、何でGoogleを始めとした企業が開発と導入を進めてきたのかといえば、文法構造が近い言語同士では、それなりのアウトプット(読んで内容を把握できる程度の)ができるようになったからです。

従来の辞書と文法をベースとした機械翻訳(RbMT)とは別に、膨大な量の対訳集(正解の訳例)を統計的に解析して結果に反映する方式の機械翻訳(SMT)が、コンピュータの処理能力の向上とともに品質を上げてきました。

技術的に細かな点は割愛して、SMTの特徴はRbMTと比べて自然に読める文章が出力されるというものです。これはこれで進歩ですし、良いのですが、茶色のm&m'sの観点からすると、人間が読んだときに自然な文章が出力されている分、内容にマズいところがあるのではないかというセンサーが働かなくなる可能性があります(蛇足ながら、これはわたしが美文家を信用していない理由でもあったりします)。

過激派からは、人間の感覚を鈍らせるような機械じゃ補助にならないから捨てちまえ、というようなセリフが聞こえてくるような気がします。この点については、恐らくポストエディットが広まるうちに問題となってくると思うのですが、茶色いm&m'sはあるのでしょうかね。プロマネ視点ではそこが気になります。

2012年4月17日火曜日

機械翻訳、言語空間、翻訳のコモディティ化

こういうニュースがありました。

秋田→飽きた ナマハゲ→はげ頭病 「機械翻訳で…」誤訳多数 観光庁が東北観光博サイト閉鎖


ビジネス倫理的な部分で話にならないのは確かですが、ここに出てくる「IT企業」が観光庁に対して何を納品する契約になっていたのか。高品質の翻訳なのか、それとも自動翻訳機能のついた多言語ウェブサイト(あるいはシステム)なのかによって、話は違ってきます。わざわざこんな退屈なことを書いたのは、ここに出てくる「IT企業」と翻訳者では扱っている商材が異なるから。

そもそも、機械翻訳という言葉の理解が、業界内でもバラツキがあるというのが現状かと思います。こうした状況で外部に対して「正しい理解」を求めるのは難しいです。

で、機械翻訳の意味とはといえば、世の中的には人間の行なっている翻訳作業を代替する技術と理解されていると思います。業界内では、人間の行なっている翻訳作業の一部を代替する技術という認識が広まってきていると思います。

現在注目されている手法は、機械翻訳のアウトプットの結果を人間が修正して仕上げていくものです。言い方を変えると、機械と一緒に翻訳をしていく、あるいは機械翻訳の結果をインターリンガとして用いるという方法です。この場合の機械翻訳は、ひとつの技術というよりは、手技と機械の混成体です。
※そんなわけで、機械翻訳という名前自体が、誤解の元になりつつあるというのが現状です。それが有効となる文脈外で使われた結果でもって、「機械翻訳なんて使えないや」というのは、開発者の方にとっても不幸な結果を招きますし、将来役立てることのできる可能性を狭めてしまうので、どんなものかなと思います。しかし別の言葉がないものかと思うのですが、無いのですね。上述の、人間が修正して仕上げる工程はポストエディット(事後編集)と呼ばれていますが、これもまたより適切な名前が見つけられるべき言葉だと思います。
なぜそうなるかは、翻訳という行為の定義にも関わってくるところです。ある言語の情報を他の言語に移し替える際には、単語の用法や文法などのある程度定まった諸規則の他に、時代や文脈とともに変化する言葉や文体の流行り廃り、それらの選択基準を考慮する必要があります。

これらの総体を、プログラミングでいう名前空間のようなイメージで、とりあえず言語空間と呼びましょうか。ともかく、最終的にターゲット言語空間の「どこ」に落としこむかの判断は人間にしかできません。完全な機械翻訳は、今のところ存在しません。そういう人工知能でも開発できれば別でしょうが。

この探索を行う空間の広さ(狭さ)が翻訳の鍵であり、読み手にとっての解釈の余地の問題です。クリエイティブな文章というのはこの探索する空間が広い、あるいは空間そのものを拡張しているものだと思います。一方で、産業翻訳では文書の構造と、文節内での用語の定義やスタイルを決めることにより、探索する空間を限定しようとしています。ここまで来れば見当がつくと思いますが、機械翻訳がどのような内容のものに適しているのかといえば、この言語空間が限定されたものです。

問題になった東北の件などは、「秋田→あきた」という言い替えに特徴的なように、解釈の余地が広がる表現を用いているので、当然ながらブレが出やすいです。人間なら「あきたは秋田の書き下し」であると文脈から推察できますが、機械にはできません。担当した会社は用語集(というよりは定訳集でしょうね)を請求したのもこうした背景あってのことです。とはいえ、往々にしてこういう場合に用語集、無いものです。わたしもよく砂を噛みました。(これについては、こちらで)

個人的には、ここで述べているようなテクニカルな点を除いても、いずれどこかでこうした問題は起きるだろうなあと思っていました。短納期や低単価の案件に限らず、明らかに機械翻訳を使った成果物に出会ったことが何度もあり、チェックが甘ければ流出する可能性は十分にありました。

そもそも、翻訳は買い手が納品物に対する評価を適切にできない可能性が出てくることから(特に多言語を扱っている場合には)、レモン市場になりやすい特徴を持っています。全体としてそうなっていないのは、翻訳者をはじめとした関係者の職業倫理で支えられている部分が大きいと思います。ただ、それも色々な要因で崩れやすくなっていますし、そもそもが全員に期待するべきものでもありません。

とはいえ、それを嘆いていてもしょうがない。個人的には、翻訳(特に産業翻訳)はコモディティになりつつあるのだと思っています。その上で、市場の動きとしては、コモディティに対してはそれがもたらす機会よりもリスクに敏感になるものですので、ビジネスとしてやっていく上ではそこが鍵になるのだろうと思います。

2012年4月15日日曜日

TAUS Tokyo Exective Forumによせて

4/19-20と、TAUS Tokyo Executive Forumが開催されます(リンク)。

TAUSそのものは、Translation Automation User Societyの頭字をとっています。その名の通り、自動翻訳の活用や普及の促進をテーマとした組織です。この自動翻訳という表現は若干トリッキーなので注意が必要なのですが、似たような意味で使われている言葉として、機械翻訳があります。

TAUSはあくまで自動翻訳がメインで、機械翻訳ではありません。ここでの自動化と機械化の差とはなんでしょうか。わたしの考えでは、機械翻訳が人間の行なっている翻訳作業の一部を代替する技術であるのに対し、自動翻訳とは翻訳の前後の工程を含めたローカリゼーション工程全体の自動化するシステムです。(これらについては、もう少し詳しい話を別記事にする予定です)

この違いは、TAUSのウェブサイトにも掲載されている下記のロードマップにも表れています。MTの後ろにTranslation Automationがきていますね。


さて、TAUSには色々や個人が参加しており、大別すると下記の4つになると思います。
  • 翻訳発注を行う企業
  • 翻訳を受注する企業(翻訳会社)
  • 翻訳者
  • 機械翻訳の研究者
わたしの所属はこのうち2番目の翻訳会社です。それぞれに自動翻訳や機械翻訳に期待しているや関心を寄せている点は異なりますが、わたしの関心はといえば、機械翻訳や自動翻訳は破壊的技術となり得るのか、という点に集約されます。儲かるかどうかはひとまず棚上げしています。

機械翻訳について言えば、コールセンターにとってブラック・スワンとして機能した実績があります。具体的にはヘルプ情報をオンラインで提供している企業の例となりますが、そこではヘルプの情報が原語(英語)のドキュメントを機械翻訳で各国語訳したものと、そのなかで問い合わせの多いものについて人間が修正を行ったものが提供されています。そして、いつでも原語のリンク先に飛んでいけます。

これがもたらした結果は、コールセンターへの問い合わせの減少でした。10%単位で減ったと聞いています。当然ながらコールセンターの縮小に繋がりました。コールセンターの運営を請けていた会社にとっては青天の霹靂だったのではないかと思います。

コールセンターの事例は、翻訳の価値やROIを考える上で重要な例となります。ヘルプ情報に機械翻訳を使ったきっかけは、全ての情報を人力で翻訳している時間も費用も無かったのだと思いますが、結果としてコールセンターの費用という軸が加わったことで、"人力翻訳vs機械翻訳"の前に"ヘルプによる情報提供vsコールセンターによる情報提供"に土俵が変わりました。場合によっては、ここに”CGM的メディアによるユーザ同士での情報交換”が加わるかも知れません。

こうしたことは、ミクロの技術的な詳細からマクロな市場の話まで、俯瞰しながら行ったり来たりしないと考えがなかなか深まりません。GALAにせよ、今は亡きLISAにせよ、この手のカンファレンスが日本で開催されることはあまりないので、とてもありがたい機会です。