R言語で、文字列でパターンの一致の有無を検出する方法について解説します。文字列の操作には、tidyverseパッケージに含まれているstringrパッケージを使用するのが便利です。ここでは、stringrパッケージのstr_detect()を使用した方法についてお伝えします。
str_detect()の概要
str_detect()は、文字列でパターンの一致の有無を検出するための関数です。str_detect()は、パターンに一致する文字列の各要素に対してTRUEを返し、それ以外の場合はFALS を返す論理ベクトルを返します。これはgrepl(pattern, string)と同等です。
str_detect()の使い方
stringr::str_detect()の使い方は次になります。
str_detect(string, pattern, negate = FALSE)
str_detect()の引数の意味
string
文字ベクトルまたは文字ベクトルに変換可能なものを指定します。
pattern = “”
検索するパターンを指定します。
デフォルトの解釈は、正規表現です。一致動作をより細かく制御するには、regex()を使用します。fixed()を使用して、固定文字列(つまり、バイトのみを比較する)を一致させます。これは高速ですが、近似値です。一般に、人間のテキストを一致させるには、指定されたロケールの文字一致ルールを尊重するcoll()が必要になります。boundary()を使用して、文字、単語、行、文の境界を一致させます。空のパターン””は、boundary(“character”) と同等です。
negate = FALSE
TRUEの場合、結果の真偽値ベクトルを反転します。
準備
あらかじめ、tidyverseパッケージを読み込んでおきます。
library(tidyverse)
str_detect()の使用例
文字列「あいうえおあいう」内で文字列「あ」を含むかどうかを確認するには次のようにします。
str_detect("あいうえお", pattern = "あ")
[1] TRUE
次のように、文字列のベクトルとして指定することもできます。
str_detect(c("あいうえお", "かきくけこ"), pattern = "あ")
[1] TRUE FALSE
R×stringr::str_detect 文字列でパターンの一致の有無を検出する