ひらがな・カタカナの変換
貼り付けた文は、この画面の中だけで処理します。変換しているのはかなだけで、漢字・英数字・記号・空白・改行はそのままです。
ひらがなに そろえる
7字を書きかえ、5字はもともと そろっていました。
カタカナに そろえる
5字を書きかえ、7字はもともと そろっていました。
入れた文の内訳
どちらに そろえるかに関わらず、入れた文そのものの数え方です。 何がいくつ入っていたか分からないと、変換できなかった字に気づけません。
- 入れた字の数
- 17字空白と改行も1字として数えています
- ひらがな
- 5字カタカナに そろえると、この数だけ字が変わります
- カタカナ(全角)
- 7字ひらがなに そろえると、この数だけ字が変わります
- カタカナ(半角)
- 0字半角カナは、全角に直してから そろえます
- どちらでも同じ字
- 2字のばす音(ー)・中黒(・)・濁点など
- かな以外の字
- 3字漢字・英数字・記号・空白・改行。触りません
この端末で、その字が本当に出せるか確かめる
Unicode に字があることと、目の前の端末で見えることは別です。 字の絵(グリフ)がフォントに入っていないと、□(豆腐)になります。 下のボタンを押すと、9字ぶんを この端末のブラウザで実際に描いてみて、絵が見つかるかどうかを調べます。
調べ方: 見えないところに1字ずつ描いて、絵が無いことが確実な符号位置(U+10FFFF・Unicode が 「文字として使わない」と決めている非文字)を描いたときと 同じ見た目になるかを比べています。 同じなら、その字はこの端末では未対応です。
よくある質問
ひらがなとカタカナは、どうやって変換しているのですか?
Unicode という文字の番号表のうえで、ひらがなとカタカナがちょうど96だけ離れて並んでいるので、番号に96を足したり引いたりしています。「あ」の番号は U+3042、「ア」は U+30A2 で、その差がちょうど96です。五十音の86字ぶんが同じだけ離れているので、対応表を持たずに計算だけで変換できます。ただし区画の端には濁点や長音符が置かれていて、そこを同じ計算で通すと別の字に化けます。この計算機は、そこに当たる13字を計算から外してあります。
「ヴ」をひらがなにすると「ゔ」になりますが、使ってよい字ですか?
Unicode には「ゔ」(U+3094)があるので変換はできます。ただし昔から使われてきた文字コードの JIS X 0208 には入っていないため、古い機械や一部の印刷では□(豆腐)になって読めないことがあります。この計算機は「ゔ」が出たときにその旨を画面に出し、いま見ている端末で本当に絵が出るかを調べるボタンも置いています。相手に確実に読ませたい文では、「ヴァイオリン」を「バイオリン」と書き換える手もあります。
「ヷ ヸ ヹ ヺ」がひらがなになりません。
これはカタカナにしかない字で、対応するひらがなが Unicode にも存在しません。ワ・ヰ・ヱ・ヲに濁点をつけた字で、外国語の V の音を書くために作られました。この計算機は消さずにそのまま残し、何字残したかを画面に出します。消してしまうと、貼り付けた文が黙って短くなり、間違いに気づけなくなるからです。「コト」を1字に組んだ「ヿ」も同じ扱いです。
長音符(ー)は変換されないのですか?
されません。ひらがなの文でもカタカナの文でも同じ字を使うからです。Unicode での正式な名前が「KATAKANA-HIRAGANA PROLONGED SOUND MARK」で、名前そのものに両方が入っています。中黒(・)や単独の濁点(゛)も同じ仲間です。もし番号を96引いてしまうと、のばす音が半濁点に化けて「コーヒー」が「こ゜ひ゜」になります。
半角カタカナも変換できますか?
できます。半角カナはいったん全角のカタカナに直してから、ひらがな・カタカナにそろえます。「ガ」のように濁点が別の1字になっているものは、先に2字を1字にまとめてから変換するので「カ゛」と濁点が離れた形にはなりません。半角の記号(。 「 」 、 ・)はかなとは別なので、そのまま残します。幅そのものを直したいときは「全角・半角の変換」のページのほうが向いています。
貼り付けた文はどこかに送られますか?
送られません。変換はすべて、いま開いているブラウザの中だけで行っています。文章をどこかのサーバーに送って処理する作りではないので、社内の文書や個人情報を含む文でも、そのまま貼り付けられます。この計算機に限らず、このサイトの道具はすべて同じ作りです。
貼り付けた文を、ひらがなにそろえたものとカタカナにそろえたものの 両方で同時に出します。 小書きの字も濁点も半濁点も、半角カナもそのまま扱えます。
ひらがなとカタカナは、ちょうど96だけ離れて並んでいます
Unicode(世界中の文字に番号をつけた表)では、ひらがなの96字ぶんの区画のすぐあとにカタカナの96字ぶんの区画が置かれています。 しかもどちらも同じ五十音の順番で並んでいます。
同じ大きさの表を、同じ順番で、すぐ隣に置いたわけです。だからどの字を見ても、相手までの距離が同じ96になります。 「あ」はU+3042、「ア」はU+30A2。「ん」はU+3093、「ン」はU+30F3。引き算をすると、どちらも96です。
だからこの変換は、対応表を持たなくてもできます。86組ぶんの表を書き写す代わりに、番号に96を足すか引くかするだけで済みます。 書き写しの間違いが入り込む余地が無いのは、そのためです。
⭐ 96という数は、区画の大きさそのものです。 16進で書くと 0x60、10進で 96。ひらがなの区画もカタカナの区画も96個ぶんの幅を持っているので、区画1つぶん進めば、隣の表の同じ場所に着くという理屈です。
ところが、96を足し引きするだけでは13字が壊れます
五十音の86字はそれでうまくいきます。困るのは区画の端です。ここには五十音の字ではなく、濁点・長音符・中黒・繰り返し記号・合字が置かれています。 同じ計算で通すと、これらが別の字に化けます。
しかも化けた先がもっともらしいところが、いちばん怖いところです。 のばす音が半濁点になり、中黒が濁点になります。エラーにならないので、変換した本人は気づけません。
カタカナからひらがなへ(96を引く)
| もとの字 | 96を引いた先 | 何が起きるか |
|---|---|---|
| ゠U+30A0 | —U+3040 | 割り当てが無い符号位置。字にならないこの番号には字が割り当てられていない |
| ヷU+30F7 | —U+3097 | 割り当てが無い符号位置。字にならないこの番号には字が割り当てられていない |
| ヸU+30F8 | —U+3098 | 割り当てが無い符号位置。字にならないこの番号には字が割り当てられていない |
| ヹU+30F9 | ◌゙U+3099 | 字ではなく前の字にくっつく濁点になる。「アヹ」が「あ゛」になり、1字ぶん短く見えるCOMBINING KATAKANA-HIRAGANA VOICED SOUND MARK |
| ヺU+30FA | ◌゚U+309A | 前の字にくっつく半濁点になる。「アヺ」が「あ゚」になるCOMBINING KATAKANA-HIRAGANA SEMI-VOICED SOUND MARK |
| ・U+30FB | ゛U+309B | 区切りの中黒が濁点になる。「ア・イ」が「あ゛い」になるKATAKANA-HIRAGANA VOICED SOUND MARK |
| ーU+30FC | ゜U+309C | のばす音が半濁点になる。「コーヒー」が「こ゜ひ゜」になるKATAKANA-HIRAGANA SEMI-VOICED SOUND MARK |
| ヿU+30FF | ゟU+309F | 「コト」が「より」になる。字としては正しいのに、言葉が入れ替わるHIRAGANA DIGRAPH YORI |
いちばん分かりやすい例が「コーヒー」です。まるごと96を引くと「こ゜ひ゜」になります。のばす音(ー)が半濁点(゜)に化けたからです。 「ア・イ」は「あ゛い」になります。
ひらがなからカタカナへ(96を足す)
| もとの字 | 96を足した先 | 何が起きるか |
|---|---|---|
| ◌゙U+3099 | ヹU+30F9 | 濁点が ヹ という字に化ける。「が」を「か」+濁点で書いた文が「カヹ」になるKATAKANA LETTER VE |
| ◌゚U+309A | ヺU+30FA | 半濁点が ヺ という字に化けるKATAKANA LETTER VO |
| ゛U+309B | ・U+30FB | 濁点が中黒になるKATAKANA MIDDLE DOT |
| ゜U+309C | ーU+30FC | 半濁点がのばす音になるKATAKANA-HIRAGANA PROLONGED SOUND MARK |
| ゟU+309F | ヿU+30FF | 「より」が「コト」になるKATAKANA DIGRAPH KOTO |
上の表の1行目と2行目は、とくに気づきにくいものです。濁点には2つの書き方があります。ふつうは「が」で1字ですが、 「か」+くっつく濁点という2字の書き方もあり、見た目はどちらも同じです。 この2字の書き方をした文に96を足すと、濁点がヹという字に化けます。
これは珍しい話ではありません。macOS で作ったファイル名は、 この2字の書き方になっていることがあります。 この計算機はくっつく記号を96ずらさずに、そのまま次の字に付けたままにします。
どちらの文でも同じ字を使うもの
変換しない字が7つあります。これは好みで決めたのではなく、Unicode の名前がそう言っています。たとえば長音符の正式な名前はKATAKANA-HIRAGANA PROLONGED SOUND MARKで、名前にカタカナとひらがなの両方が入っています。
| 字 | Unicode での名前 | どういうものか |
|---|---|---|
| ーU+30FC | KATAKANA-HIRAGANA PROLONGED SOUND MARK | のばす音(長音符)。名前に KATAKANA と HIRAGANA の両方が入っている ── どちらの文でも同じこの1字を使う |
| ゛U+309B | KATAKANA-HIRAGANA VOICED SOUND MARK | 単独で置く濁点。前の字にはくっつかない |
| ゜U+309C | KATAKANA-HIRAGANA SEMI-VOICED SOUND MARK | 単独で置く半濁点 |
| ◌゙U+3099 | COMBINING KATAKANA-HIRAGANA VOICED SOUND MARK | 前の字にくっつく濁点。「か」+これで「が」に見える。macOS のファイル名はこの書き方のことがある |
| ◌゚U+309A | COMBINING KATAKANA-HIRAGANA SEMI-VOICED SOUND MARK | 前の字にくっつく半濁点 |
| ゠U+30A0 | KATAKANA-HIRAGANA DOUBLE HYPHEN | 外国の人名の区切り(ジャン゠ポールの゠)。これも名前に両方が入っている |
| ・U+30FB | KATAKANA MIDDLE DOT | 中黒。名前は KATAKANA だが、ひらがな用の中黒という字は Unicode に無い。ひらがなの文でもこの字を使う |
⭐ 昔の文字コード(JIS X 0208)でも、同じ考え方がとられていました。ー も ・ も ゛ も、ひらがなの区にもカタカナの区にも入っていません。 どちらにも属さない「記号」の区(1区)に、まとめて置かれています。 Unicode が名前で示していることを、40年ほど前の規格は置き場所で示していた わけです。
カタカナにしかない字があります
ヷ ヸ ヹ ヺ。ワ・ヰ・ヱ・ヲに濁点をつけた字で、外国語のV の音を書くために作られました。これに当たるひらがなは、Unicode にもありません。「ゔ」が「JIS には無いが Unicode にはある」のとは別の話で、足し引きした先の番号そのものが空いているか、まったく別の字です。
| 字 | Unicode での名前 | どういうものか |
|---|---|---|
| ヷU+30F7 | KATAKANA LETTER VAカタカナ側の字 | ワに濁点。VA の音を書くための字。ひらがなの VA は Unicode に無い |
| ヸU+30F8 | KATAKANA LETTER VIカタカナ側の字 | ヰ(古いイ)に濁点。ひらがなの VI は Unicode に無い |
| ヹU+30F9 | KATAKANA LETTER VEカタカナ側の字 | ヱ(古いエ)に濁点。ひらがなの VE は Unicode に無い |
| ヺU+30FA | KATAKANA LETTER VOカタカナ側の字 | ヲに濁点。ひらがなの VO は Unicode に無い |
| ヿU+30FF | KATAKANA DIGRAPH KOTOカタカナ側の字 | 「コト」の2字を1字に組んだもの。昔の縦書きで使われた。ひらがなの「こと」を1字にした字は無い |
| ゟU+309F | HIRAGANA DIGRAPH YORIひらがな側の字 | 「より」の2字を1字に組んだもの。96を足すと ヿ(コト)になってしまう ── 距離は合っているのに別の言葉 |
逆にひらがなにしかない字も1つあります。ゟは「より」の2字を1字に組んだもので、昔の手紙の結びなどに使われました。 ここが面白いところで、ゟ に96を足すと ヿ になります。 ヿ は「コト」を組んだ字なので、距離は合っているのに言葉が別物です。 だからこの計算機は、この2字を対にしていません。
どちらも、消さずにそのまま残します。変換できなかった字を黙って落とすと、貼り付けた文が知らないうちに短くなります。 何字残したのかは画面に数で出しています。
「ゔ」は、昔の文字コードに入っていません
ヴをひらがなにするとゔになります。Unicode にHIRAGANA LETTER VU(U+3094)としてちゃんと登録されているので、 変換そのものはできます。
ところが、日本で長く使われてきた文字コードJIS X 0208を見ると、事情が変わります。 この規格でひらがなが並んでいる4区には83字、カタカナの5区には86字が入っています。カタカナのほうが3字多いのです。
多い3字がヴ・ヵ・ヶです。つまりゔ・ゕ・ゖ は入っていません。 ひらがなは「ぁ」から「ん」までで終わっていて、その先が無いのです。
だから「ゔ」は、環境によっては□(豆腐)になります。変換した画面では読めていても、貼り付けた先で読めないことがあります。 上のボタンを押すと、いま見ている端末でその字の絵が本当に入っているかを確かめられます。
濁点つきの字は、全角では1字・半角では2字
「ガ」は全角では1字です(U+30AC)。「カ」と濁点が別々にあるのではなく、濁点つきで1つの字として番号が振られています。 だから96を足し引きするだけで「が」になります。濁点のために特別な処理をしなくてよいのは、そのためです。
ところが半角カナには濁点つきの字がありません。「ガ」は「カ」と「゙」の2字です。1字ずつ順に置きかえると、先に「カ」が「カ」になり、 あとに残った「゙」が「カ゛」と離れた形で取り残されます。 この計算機は、2字の組み合わせを先にまとめてから変換します。
幅そのものを直したいときは「全角・半角の変換」のページのほうが向いています。 こちらはかなだけを受け持つので、半角の記号(。 「 」 、 ・)には触りません。
混ざった文をそろえると、元には戻せません
ひらがなだけの文をカタカナにして、またひらがなに戻せば、ぴったり元どおりになります。 対応が1対1なので、往復しても情報が減りません。
けれどひらがなとカタカナが混ざった文は別です。 「カバのポタモ」をひらがなにそろえると「かばのぽたも」になりますが、ここでどこがカタカナだったかという情報が消えます。 だからカタカナに戻すと「カバノポタモ」になり、「の」が「ノ」に変わってしまいます。
消えたものは計算では戻せません。この計算機は入力欄をつねに残したままにしてあるので、元の文はそこに残っています。 変換した結果で上書きしない作りにしているのは、そのためです。
Unicode の名前は、日本式ローマ字で書かれています
おまけです。この計算機が使っている Unicode の正式な名前を見ると、 駅の看板とはちがうローマ字が使われています。
| 字 | Unicode での名前 | 駅名などの書き方 |
|---|---|---|
| し / シ | SI | shi |
| ち / チ | TI | chi |
| つ / ツ | TU | tsu |
| ふ / フ | HU | fu |
| じ / ジ | ZI | ji |
左が日本式(訓令式に近い書き方)、右がヘボン式です。 日本式のほうは五十音表の並びに素直で、「さ し す せ そ」がSA SI SU SE SOと、同じ子音でそろいます。 ヘボン式は英語の読みに寄せているのでshiだけ形が変わります。どちらが正しいという話ではなく、何に合わせたかの違いです。
数値と字の対応の出どころ: 符号位置と正式名はUnicode Consortium の UnicodeData.txt(新しいタブで開きます)、JIS X 0208 の中身は同じくJIS0208.TXT(新しいタブで開きます)から取っています。 このページに出る対応表は手で書いたものではなく、単体テストが1字ずつ正式名と突き合わせています。