調べて分かる道具箱

絵文字だけ抽出・削除

入力した文章はこの画面の中だけで処理します。

絵文字だけの一覧

☀️🐶🌳🍦🍦😊

絵文字は6個見つかりました。

絵文字を除いた文章

絵文字だけを取り除きます。絵文字以外の文字は1つも変えません。

種類ごとの内訳

見つかった絵文字の種類ごとの数と内部の値の数
絵文字見つかった数コードポイント数
☀️12
🐶11
🌳11
🍦21
😊11

コードポイント数が2以上の行は、見た目は1つでも複数の文字の組み合わせです。家族の絵文字・国旗・肌の色を変えた絵文字・数字の丸囲みは、 いずれも複数の Unicode の値を1まとまりに読ませたものです。

よくある質問

©や™のような記号まで消えるのはなぜですか?

この道具は Unicode の Extended_Pictographic という分類を「絵文字」として使っていて、©(コピーライト)・®・™・☺ などの古い記号もその分類に入っているためです。これらは絵文字が生まれる前からある文字ですが、Unicode 上は絵文字として表示してよい候補とされています。「© 2026」のような表記を残したい文章では、削除した結果を確かめてから使ってください。どの分類で判定したかを書くのは、答えの数がツールごとに違う理由を説明できるようにするためです。

家族の絵文字のように、複数人がつながって見える絵文字はどう数えますか?

見た目どおり1個と数えます。👨‍👩‍👧‍👦 は画面では1つの絵文字ですが、Unicodeの内部では「男性」「つなぐための見えない文字(ZWJ)」「女性」「ZWJ」「女の子」「ZWJ」「男の子」の7個の値をつなげたものです。この道具は人が1文字と感じるまとまり(書記素クラスタ)で数えるので、内部の値の数に関係なく1個として扱い、取り除くときも4人分がまるごと1単位で消えます。

国旗の絵文字(🇯🇵など)が特別あつかいなのはなぜですか?

国旗の絵文字は、アルファベット2文字ぶんの「地域を表す記号」を組み合わせて作られています。🇯🇵 は2個の値からできていて、これは家族の絵文字などが使う「ふつうの絵文字を表す性質」とは別のUnicodeの分類に属します。分類が違うので、どちらか一方だけを見て判定する実装だと、国旗だけ拾えなかったり、逆に国旗だけ消せなかったりします。

肌の色を指定した絵文字は、指定なしの絵文字と別に数えられますか?

別に数えます。👍🏽 は「土台の絵文字」と「肌の色を指定する記号」の2個の値からできていて、指定なしの絵文字(1個の値)とは種類ごとの内訳で別の行に分かれます。

①のような数字の丸囲みも絵文字として扱われますか?

扱われます。1️⃣ のような数字の丸囲み(キーキャップと呼ばれます)は、土台の数字と丸で囲む記号を合わせた3個の値からできています。土台がふつうの数字の文字なので、文章の中の「3本」のような単独の数字と混同しないよう、丸で囲む記号がセットになっているものだけを絵文字として扱います。

絵文字を取り除いたあとの文章に、余分な空白は残りますか?

絵文字だけを取り除き、それ以外の文字は1つも変えません。もともと絵文字の前後にあった空白はそのまま残ります。文章の空白まで整えたいときは、このサイトの「文章の下ごしらえ」もあわせて使ってください。

入力した文章はどこかに送られますか?

送られません。この計算機はブラウザの中だけで動いており、文章がサーバーに届く経路そのものがありません。未公開の原稿でも、そのまま貼り付けられます。

貼り付けた文章から、絵文字だけの一覧・絵文字を取り除いた文章・絵文字の数を同時に出します。

絵文字は「見た目1文字」だが、中身は複数の値でできている

Unicode が絵文字のルールを定めた仕様書(Unicode Technical Standard #51)は、 絵文字の並びについてこう書いています。

“Note that all emoji sequences are single grapheme clusters: there is never a grapheme cluster boundary within an emoji sequence.” (絵文字の並びはどれも1つの書記素クラスタである。絵文字の並びの内側に、 書記素クラスタの境界ができることは無い)

書記素クラスタとは、人が「1文字」と感じるまとまりのことです。つまり「見た目が1文字であること」自体が、仕様として保証されている一方で、その内側が複数のUnicodeの値でできていることとは矛盾しません。👨‍👩‍👧‍👦 が7個の値をつなげたものなのに1つの絵文字に見えるのは、 崩れた表示ではなく仕様どおりの姿です。

出典: Unicode Technical Standard #51「Unicode Emoji」 1.4.5節 Emoji Sequences (https://unicode.org/reports/tr51/#Emoji_Sequences)

「絵文字らしさ」の条件は1つに決まらない

この計算機は、ある文字のまとまりを絵文字と判定するときに、性質の違う3つの条件を見ています。 1つの条件だけでは、絵文字の一部しか拾えないためです。

1つめは、家族の絵文字のようなふつうの絵文字とその組み合わせです。2つめは国旗で、アルファベットを表す記号を2つ組み合わせて作られており、 1つめとは別のUnicodeの分類に属します。3つめは数字や「#」「*」の丸囲みで、土台になっている文字自体はふつうの数字や記号なので、丸で囲む記号とセットになっているかどうかで判定します。

「絵文字の範囲」を1つの条件だけで済ませようとすると、 国旗(別の分類)か丸囲み(土台がふつうの文字)のどちらかを取りこぼします。 この道具は3つを別々に確かめています。

肌の色の指定も、後から足された仕組み

絵文字に肌の色を指定できるようになったのは、最初から決まっていた仕様ではありません。 あとから「肌の色を指定する記号」を5種類追加し、絵文字の直後にくっつける形で表現するようになりました。👍🏽 が2個の値でできているのはこのためです。 土台の絵文字を変えずに肌の色だけを重ねる仕組みなので、 指定なしの絵文字と指定ありの絵文字は、種類ごとの内訳では別の行に数えられます。

出典: 同 2.4節 Diversity (https://unicode.org/reports/tr51/#Diversity)。肌の色を指定する記号は5種類、と明記されています。