文字数カウント
入力した文章はこの画面の中だけで処理します。
まだ何も入っていません。上の欄に貼り付けると、打っている途中から数え始めます。
| 数え方 | 文字数 |
|---|---|
| 文字数人が1文字と感じる単位(書記素) | 0 |
| 空白を除くスペース・改行・タブを数えない | 0 |
| 改行を除くスペースは数える | 0 |
| 行数 | 0 |
| 単語数(空白で区切る)英語の文章でふつうに使われる数え方 | 0 |
| 単語数(辞書で区切る)日本語も切れる。助詞(は・が・を)も1語 | 0 |
| 原稿用紙400字詰め換算 | 0.00 枚 |
プログラムから見た文字数
文字数制限の実装によって、同じ文章でも数が変わります。絵文字を含む文章が 「文字数を超えています」と弾かれるのは、たいていここが原因です。
| コードポイントUnicode の文字の個数 | 0 |
|---|---|
| UTF-16JavaScript の length・多くの入力欄の上限 | 0 |
| UTF-8 バイト数データベースの桁数・通信量 | 0 |
よくある質問
絵文字は何文字と数えますか?
この計算機は、人が1文字と感じるまとまり(書記素)で数えます。家族の絵文字 👨👩👧👦 は見た目どおり1文字です。ただしプログラムの世界では同じ絵文字が11文字と数えられることがあり、その値も併記しています。
文字数制限に引っかかるのに、数えると足りているのはなぜですか?
数え方が違うためです。多くの入力欄は UTF-16 のコード単位で上限を判定しています。絵文字や一部の漢字は1文字で2つ分と数えられるため、見た目の文字数より多く消費します。この計算機では UTF-16 の値も同時に出しているので、そちらと制限を比べてください。
空白を除いた文字数はどれを使えばよいですか?
提出先の指定によります。作文や小論文では句読点を含めて数えるのが一般的で、空白を除く指定がある場合はスペースと改行を数えません。指定がなければ、空白を含む文字数を使えば不足することはありません。
原稿用紙の枚数はどう計算していますか?
1枚400字(20字×20行)として、文字数を400で割った値です。実際の原稿用紙では段落の途中で行が変わるため、この計算より枚数が増えます。おおよその目安として使ってください。
英語の単語数は数えられますか?
数えられます。表に「単語数(空白で区切る)」の行が出ます。英語の文章でふつうに使われる数え方で、空白と改行で区切って数えています。ただし日本語には語の切れ目に空白が無いので、この数え方だと「今日はいい天気ですね。」は1語になります。日本語も切りたいときは、その下の「単語数(辞書で区切る)」を見てください。
日本語の単語数が、思ったより多いのはなぜですか?
助詞まで1語に数えているためです。辞書で区切る数え方だと「今日はいい天気ですね。」は6語(今日/は/いい/天気/です/ね)になります。「は」や「です」も1語です。なお区切り方はお使いのブラウザに入っている辞書で決まるので、機種や版によって少し違う数になることがあります。
入力した文章はどこかに送られますか?
送られません。この計算機はブラウザの中だけで動いており、文章がサーバーに届く経路そのものがありません。未公開の原稿や個人情報を含む文章でも、そのまま貼り付けられます。
貼り付けた文章を、入力しながら数えます。絵文字や結合文字も見た目どおり1文字として数えます。
「1文字」には3つの定義がある
文字数を数えるという作業は、一見すると答えが1つに決まりそうに見えます。 ところが実際には、何を1文字と見なすかで3通りの答えが出ます。 どれが正しいということはなく、目的によって使い分けるものです。
1つめは書記素クラスタです。人が読んで「1文字」と感じるまとまりを指します。 濁点つきの「が」も、肌の色を指定した絵文字も、家族の絵文字も、すべて1文字です。 提出物の字数を数えるときに使うのはこれです。
2つめはコードポイントです。Unicode が文字に振った番号の個数を数えます。 家族の絵文字は4人分の絵文字と3つの接合子で 7 と数えられます。
3つめはUTF-16 のコード単位です。多くのプログラミング言語が「文字列の長さ」として返す値で、 入力欄の文字数制限もたいていこれで判定されています。 絵文字や、JIS 第3・第4水準の一部の漢字(𠮷 など)は、1文字で2つ分を消費します。
投稿しようとして「文字数を超えています」と言われたのに、数えると足りている ── この食い違いは、ほぼすべてこの3つの定義のずれから生まれます。
バイト数が必要になる場面
データベースの桁数や、通信量の見積もりでは、文字数ではなくバイト数を使います。 UTF-8 では ASCII が1バイト、ひらがなや漢字が3バイト、多くの絵文字が4バイトです。 「255文字まで」と書かれた仕様が実は255バイトを指していて、 日本語だと85文字しか入らなかった、という取り違えはよく起きます。
⭐ 「単語数」は、日本語と英語で数え方が違います
英語は語と語のあいだに空白があるので、空白で区切れば単語が数えられます。 ところが日本語には語の切れ目に空白がありません。 だから同じやり方で数えると、「今日はいい天気ですね。」は1語── まるごと1つ ── になってしまいます。
そこでこの道具は2つとも出しています。 辞書で区切る数え方なら、同じ文が 6語になります。
今日/は/いい/天気/です/ね
助詞(は・が・を)も1語に数えるので、 「単語」という言葉から想像する数より多く出ます。 学校で習う「文節」とも区切りが違います。
この区切り方は、お使いのブラウザに入っている辞書で決まります。同じ文でも、機種やブラウザの版によって少し違う数になることがあります。 辞書はブラウザごとに更新されるもので、こちらで固定できません。 ⭐ だから「絶対の正解が1つある」とは書きません。
「が」の書き方は2通りある
Unicode には「が」という文字が1つの番号で用意されています。それとは別に、「か」の うしろに濁点だけの文字を置く書き方もあります。この濁点は、前の文字にくっついて表示 される部品です。どちらの書き方でも、画面には同じ「が」が出ます。中身は、前者が1文 字、後者が2文字です。
Unicode が配っている文字の一覧表には、「が」の中身が「か」と濁点に分かれることが書 いてあります。ひらがなとカタカナのうち、濁点や半濁点が付く58字は、どれも2通りの書 き方ができます。同じに見える文字が、機械の中では違う並びになっているわけです。
そこで、どちらの書き方でも同じ扱いにするために、形をそろえる手順が決まっています。 Unicode はこれを正規化と呼びます。くっつけた形にそろえるやり方と、ばらした形にそろ えるやり方があります。中身が同じ文字列なら、そろえたあとは必ず同じ並びになります。 だから文章を比べたり検索したりするときは、先にそろえてから比べます。
出どころ: Unicode Standard Annex #15「Unicode Normalization Forms」(新しいタブで開きます)と Unicode Character Database「UnicodeData.txt」(新しいタブで開きます)の原文。
同じ漢字の形を選ぶ、見えない文字
名字や地名の漢字は、同じ字でも形が少しずつ違うことがあります。そこで Unicode に は、漢字のうしろに「異体字セレクタ」という文字を置いて、どの形で見せるかを伝える仕 組みがあります。異体字セレクタは、それ自体では画面に何も出しません。それでも中身と しては1文字ぶん増えます。
漢字と異体字セレクタの組み合わせは登録制です。2026年8月3日版の登録簿を数えると、 29,642通りの組み合わせが載っていて、相手になる漢字は15,304字ありました。いちばん多 いのは「邉」で、この1字だけで32通りの形が登録されています。いまは1つの漢字につき 240通りまで登録できます。
一度登録した組み合わせの意味は、ずっとそのまま保たれる決まりになっています。昔の文 書を開いたときに、字の形が勝手に変わらないようにするためです。登録簿は誰でも読める ように公開されていて、どの組み合わせがどの形を指すのかを確かめられます。
出どころ: Unicode Technical Standard #37「Unicode Ideographic Variation Database」(新しいタブで開きます)と Ideographic Variation Database「IVD_Sequences.txt」(2026-08-03 版)(新しいタブで開きます)の原文。
国旗の絵文字は、文字を2つ並べて作る
絵文字の国旗は、特別なアルファベットを2つ並べて作ります。このアルファベットは「地 域表示記号」と呼ばれ、A から Z まで26個あります。2つ並べると、国や地域を表す2文字 の記号になります。地域表示記号は、この使い方のためだけに用意された文字です。
日本の国旗 🇯🇵 の中身は、地域表示記号の J と P です。Unicode の一覧表では、それぞれ 「REGIONAL INDICATOR SYMBOL LETTER J」「REGIONAL INDICATOR SYMBOL LETTER P」という名 前が付いています。旗として表示してよい組み合わせは一覧表で決めてあり、2026年4月30 日版には259通り載っています。
Unicode は、この2文字が表しているのは地域だと説明しています。そのため同じ2文字で も、機械によって出てくる旗の絵が違うことがあります。 その旗の絵を持っていない機械では、J と P の2文字が四角の中に並んで見えることもあります。
出どころ: Unicode Technical Standard #51「Unicode Emoji」(新しいタブで開きます)と emoji-sequences.txt(Version 18.0・2026-04-30 版)(新しいタブで開きます)の原文。
文字の番号には、わざと空けてある2,048個がある
文字を16ビットの数で表すやり方があります。16ビットで表せる数は65,536通りです。世 界中の文字を集めると、この数を超えます。
そこで、数を2つ並べて1つの文字を表す方法が決まりました。前半用の数と後半用の数に は、それぞれ10ビットの空きがあります。合わせて20ビットなので、1,048,576通りを表せ ます。1つの数で表せる65,536通りと合わせると、 用意された番号は全部で1,114,112個です。
前半用と後半用に使う番号は、U+D800 から U+DFFF までの2,048個です。この2,048個には 文字そのものを入れないと決められています。前半用と後半用で番号の範囲が分かれている ので、文章の途中から読み始めても、いま見ている数が前半か後半かが分かります。
文章をバイトの並びに直す UTF-8 という書き方では、この2,048個の番号を書き表すことを 禁じています。番号の空きは、どの書き方でも空きのままです。
出どころ: RFC 2781「UTF-16, an encoding of ISO 10646」(新しいタブで開きます)と RFC 3629「UTF-8, a transformation format of ISO 10646」(新しいタブで開きます)の原文。