Wyrażenie regularne pasujące do znaków spoza ASCII?

237

Jaki jest najłatwiejszy sposób dopasowania znaków spoza ASCII w wyrażeniu regularnym? Chciałbym dopasować wszystkie słowa osobno w ciągu wejściowym, ale językiem może nie być angielski, więc będę musiał dopasować takie elementy, jak ü, ö, ß i ñ. Jest to również w Javascript / jQuery, więc każde rozwiązanie będzie musiało się do tego zastosować.

Paul Wicks
źródło
1
Czy chcesz dopasować wszystkie litery lub wszystkie znaki? Na przykład, czy chcesz uwzględnić interpunkcję, cyfry, białe znaki oraz dowolne znaki i symbole? Mówiąc, że chcesz dopasować all words, brzmi to tak, jakbyś chciał tylko liter nieanglojęzycznych, a nie wszystkich znaków innych niż angielski, jak podaje tytuł pytania.
hippietrail

Odpowiedzi:

253

To powinno to zrobić:

[^\x00-\x7F]+

Pasuje do każdego znaku, który nie jest zawarty w zestawie znaków ASCII (0-127, tj. Od 0x0 do 0x7F).

Możesz zrobić to samo z Unicode:

[^\u0000-\u007F]+

W przypadku Unicode możesz przejrzeć te 2 zasoby:

Jeremy Ruten
źródło
28
To nie odpowiada na pytanie o dopasowanie słów ze znakami innymi niż angielski ...
st.
34
Nie ma czegoś takiego jak „znak, którego kod ASCII jest większy niż 128” !!!
tchrist
29
Skończyłem definiować [\u00BF-\u1FFF\u2C00-\uD7FF\w]jako list.
Markus von Broady,
24
@jackocnr Najpierw mała poprawka: [\u00C0-\u1FFF\u2C00-\uD7FF\w](bez odwróconego znaku zapytania¿ ), podobnie jak w przypadku zakresów, patrz BMP . 00C0jest Àw dodatku Latin-1 , 1FFFjest ostatnim znakiem greckiego rozszerzonego, 2C00jest pierwszą literą w języku głagolicy i D7FFostatnim znakiem w Hangul Jamo Extended-B. To wszystko oprócz: symboli i znaków specjalnych na 2 pierwszych blokach; symbole w środkowych blokach; surogaty, strefa prywatna i znaki specjalne w blokach końcowych.
Markus von Broady
7
Ta odpowiedź jest niepoprawna. ASCII nie obejmuje U + 0080 PADDING CHARACTER * . Gdyby tak było, ASCII składałby się ze 129 znaków zamiast 128.
Mathias Bynens
159
var words_in_text = function (text) {
    var regex = /([\u0041-\u005A\u0061-\u007A\u00AA\u00B5\u00BA\u00C0-\u00D6\u00D8-\u00F6\u00F8-\u02C1\u02C6-\u02D1\u02E0-\u02E4\u02EC\u02EE\u0370-\u0374\u0376\u0377\u037A-\u037D\u0386\u0388-\u038A\u038C\u038E-\u03A1\u03A3-\u03F5\u03F7-\u0481\u048A-\u0527\u0531-\u0556\u0559\u0561-\u0587\u05D0-\u05EA\u05F0-\u05F2\u0620-\u064A\u066E\u066F\u0671-\u06D3\u06D5\u06E5\u06E6\u06EE\u06EF\u06FA-\u06FC\u06FF\u0710\u0712-\u072F\u074D-\u07A5\u07B1\u07CA-\u07EA\u07F4\u07F5\u07FA\u0800-\u0815\u081A\u0824\u0828\u0840-\u0858\u08A0\u08A2-\u08AC\u0904-\u0939\u093D\u0950\u0958-\u0961\u0971-\u0977\u0979-\u097F\u0985-\u098C\u098F\u0990\u0993-\u09A8\u09AA-\u09B0\u09B2\u09B6-\u09B9\u09BD\u09CE\u09DC\u09DD\u09DF-\u09E1\u09F0\u09F1\u0A05-\u0A0A\u0A0F\u0A10\u0A13-\u0A28\u0A2A-\u0A30\u0A32\u0A33\u0A35\u0A36\u0A38\u0A39\u0A59-\u0A5C\u0A5E\u0A72-\u0A74\u0A85-\u0A8D\u0A8F-\u0A91\u0A93-\u0AA8\u0AAA-\u0AB0\u0AB2\u0AB3\u0AB5-\u0AB9\u0ABD\u0AD0\u0AE0\u0AE1\u0B05-\u0B0C\u0B0F\u0B10\u0B13-\u0B28\u0B2A-\u0B30\u0B32\u0B33\u0B35-\u0B39\u0B3D\u0B5C\u0B5D\u0B5F-\u0B61\u0B71\u0B83\u0B85-\u0B8A\u0B8E-\u0B90\u0B92-\u0B95\u0B99\u0B9A\u0B9C\u0B9E\u0B9F\u0BA3\u0BA4\u0BA8-\u0BAA\u0BAE-\u0BB9\u0BD0\u0C05-\u0C0C\u0C0E-\u0C10\u0C12-\u0C28\u0C2A-\u0C33\u0C35-\u0C39\u0C3D\u0C58\u0C59\u0C60\u0C61\u0C85-\u0C8C\u0C8E-\u0C90\u0C92-\u0CA8\u0CAA-\u0CB3\u0CB5-\u0CB9\u0CBD\u0CDE\u0CE0\u0CE1\u0CF1\u0CF2\u0D05-\u0D0C\u0D0E-\u0D10\u0D12-\u0D3A\u0D3D\u0D4E\u0D60\u0D61\u0D7A-\u0D7F\u0D85-\u0D96\u0D9A-\u0DB1\u0DB3-\u0DBB\u0DBD\u0DC0-\u0DC6\u0E01-\u0E30\u0E32\u0E33\u0E40-\u0E46\u0E81\u0E82\u0E84\u0E87\u0E88\u0E8A\u0E8D\u0E94-\u0E97\u0E99-\u0E9F\u0EA1-\u0EA3\u0EA5\u0EA7\u0EAA\u0EAB\u0EAD-\u0EB0\u0EB2\u0EB3\u0EBD\u0EC0-\u0EC4\u0EC6\u0EDC-\u0EDF\u0F00\u0F40-\u0F47\u0F49-\u0F6C\u0F88-\u0F8C\u1000-\u102A\u103F\u1050-\u1055\u105A-\u105D\u1061\u1065\u1066\u106E-\u1070\u1075-\u1081\u108E\u10A0-\u10C5\u10C7\u10CD\u10D0-\u10FA\u10FC-\u1248\u124A-\u124D\u1250-\u1256\u1258\u125A-\u125D\u1260-\u1288\u128A-\u128D\u1290-\u12B0\u12B2-\u12B5\u12B8-\u12BE\u12C0\u12C2-\u12C5\u12C8-\u12D6\u12D8-\u1310\u1312-\u1315\u1318-\u135A\u1380-\u138F\u13A0-\u13F4\u1401-\u166C\u166F-\u167F\u1681-\u169A\u16A0-\u16EA\u1700-\u170C\u170E-\u1711\u1720-\u1731\u1740-\u1751\u1760-\u176C\u176E-\u1770\u1780-\u17B3\u17D7\u17DC\u1820-\u1877\u1880-\u18A8\u18AA\u18B0-\u18F5\u1900-\u191C\u1950-\u196D\u1970-\u1974\u1980-\u19AB\u19C1-\u19C7\u1A00-\u1A16\u1A20-\u1A54\u1AA7\u1B05-\u1B33\u1B45-\u1B4B\u1B83-\u1BA0\u1BAE\u1BAF\u1BBA-\u1BE5\u1C00-\u1C23\u1C4D-\u1C4F\u1C5A-\u1C7D\u1CE9-\u1CEC\u1CEE-\u1CF1\u1CF5\u1CF6\u1D00-\u1DBF\u1E00-\u1F15\u1F18-\u1F1D\u1F20-\u1F45\u1F48-\u1F4D\u1F50-\u1F57\u1F59\u1F5B\u1F5D\u1F5F-\u1F7D\u1F80-\u1FB4\u1FB6-\u1FBC\u1FBE\u1FC2-\u1FC4\u1FC6-\u1FCC\u1FD0-\u1FD3\u1FD6-\u1FDB\u1FE0-\u1FEC\u1FF2-\u1FF4\u1FF6-\u1FFC\u2071\u207F\u2090-\u209C\u2102\u2107\u210A-\u2113\u2115\u2119-\u211D\u2124\u2126\u2128\u212A-\u212D\u212F-\u2139\u213C-\u213F\u2145-\u2149\u214E\u2183\u2184\u2C00-\u2C2E\u2C30-\u2C5E\u2C60-\u2CE4\u2CEB-\u2CEE\u2CF2\u2CF3\u2D00-\u2D25\u2D27\u2D2D\u2D30-\u2D67\u2D6F\u2D80-\u2D96\u2DA0-\u2DA6\u2DA8-\u2DAE\u2DB0-\u2DB6\u2DB8-\u2DBE\u2DC0-\u2DC6\u2DC8-\u2DCE\u2DD0-\u2DD6\u2DD8-\u2DDE\u2E2F\u3005\u3006\u3031-\u3035\u303B\u303C\u3041-\u3096\u309D-\u309F\u30A1-\u30FA\u30FC-\u30FF\u3105-\u312D\u3131-\u318E\u31A0-\u31BA\u31F0-\u31FF\u3400-\u4DB5\u4E00-\u9FCC\uA000-\uA48C\uA4D0-\uA4FD\uA500-\uA60C\uA610-\uA61F\uA62A\uA62B\uA640-\uA66E\uA67F-\uA697\uA6A0-\uA6E5\uA717-\uA71F\uA722-\uA788\uA78B-\uA78E\uA790-\uA793\uA7A0-\uA7AA\uA7F8-\uA801\uA803-\uA805\uA807-\uA80A\uA80C-\uA822\uA840-\uA873\uA882-\uA8B3\uA8F2-\uA8F7\uA8FB\uA90A-\uA925\uA930-\uA946\uA960-\uA97C\uA984-\uA9B2\uA9CF\uAA00-\uAA28\uAA40-\uAA42\uAA44-\uAA4B\uAA60-\uAA76\uAA7A\uAA80-\uAAAF\uAAB1\uAAB5\uAAB6\uAAB9-\uAABD\uAAC0\uAAC2\uAADB-\uAADD\uAAE0-\uAAEA\uAAF2-\uAAF4\uAB01-\uAB06\uAB09-\uAB0E\uAB11-\uAB16\uAB20-\uAB26\uAB28-\uAB2E\uABC0-\uABE2\uAC00-\uD7A3\uD7B0-\uD7C6\uD7CB-\uD7FB\uF900-\uFA6D\uFA70-\uFAD9\uFB00-\uFB06\uFB13-\uFB17\uFB1D\uFB1F-\uFB28\uFB2A-\uFB36\uFB38-\uFB3C\uFB3E\uFB40\uFB41\uFB43\uFB44\uFB46-\uFBB1\uFBD3-\uFD3D\uFD50-\uFD8F\uFD92-\uFDC7\uFDF0-\uFDFB\uFE70-\uFE74\uFE76-\uFEFC\uFF21-\uFF3A\uFF41-\uFF5A\uFF66-\uFFBE\uFFC2-\uFFC7\uFFCA-\uFFCF\uFFD2-\uFFD7\uFFDA-\uFFDC]+)/g;
    return text.match(regex);
};

words_in_text('Düsseldorf, Köln, Москва, 北京市, إسرائيل !@#$');

// returns array ["Düsseldorf", "Köln", "Москва", "北京市", "إسرائيل"]

Ten regex dopasuje wszystkie słowa w tekście dowolnego języka ...

rjanjic
źródło
61
Czary, które nam udostępniłeś ...: v
Luke Madhanga
9
Dlaczego jesteś pewien, że pasuje do wszystkich słów w tekście? Jakieś źródło?
dumitru
7
@rjanjic, czy możesz umieścić jakieś źródła tego? Bardzo chciałbym zobaczyć, jak ten regex się ułożył.
radiowizualny
3
@dumitru Oto źródło do sprawdzenia: fileformat.info/info/unicode/block/index.htm
ESL
7
Pasuje do wszystkich znaków we wszystkich językach[\u00A0-\uD7FF\uF900-\uFDCF\uFDF0-\uFFEF]
STAL
80

Sytuacja z wyrażeniami regularnymi, Unicode i JavaScript jest do kitu. To niedorzeczne, że programiści powinni polegać na bibliotekach zewnętrznych, aby rozpoznać, że „Αλφα” to słowo, a nawet, że „é” to litera.

Ale tak to idzie.

Ten facet napisał dobrą bibliotekę do obsługi Unicode w JavaScript Regexes:

http://blog.stevenlevithan.com/archives/javascript-regex-and-unicode

Rzeczy w Unicode to wtyczka do tej biblioteki wyrażeń regularnych:

http://xregexp.com/

Oto post o rozszerzeniu Unicode:

http://blog.stevenlevithan.com/archives/xregexp-unicode-plugin

I sama strona rozszerzenia:

http://xregexp.com/plugins/

Świetna robota, ale wciąż mnie denerwuje, że Javascript jest pod tym względem bardzo zacofany.

(Napisał książkę dla O'Reilly na ten temat, więc jest całkiem możliwe, że wie o czym mówi).

Zaimplementował to, dodając tabele znaków o określonych właściwościach. Następnie, gdy konstruujesz wyrażenie regularne w jego bibliotece, \p{charclass}zostaje zastąpione przez [allthecharactersintheclass].

GOTO 0
źródło
1
Twitter ma również przyjemną bibliotekę do analizowania tekstu, która obejmuje wiele języków, chociaż (oczywiście) bardzo skoncentrowana na hashtagach
Michael Marsh
53

Ucieka właściwość Unicode należą do funkcji ES2018.

Podstawowe użycie

Za pomocą znaków ucieczki właściwości Unicode można dopasować literę z dowolnego języka za pomocą następującego prostego wyrażenia regularnego:

/\p{Letter}/u

Lub za pomocą skrótu, nawet jeszcze krótszego:

/\p{L}/u

Dopasowane słowa

Jeśli chodzi o konkretny przypadek użycia pytania (dopasowanie słów), należy pamiętać, że można używać znaków ucieczki właściwości Unicode w klasach znaków, co ułatwia dopasowanie liter razem z innymi znakami słów, takimi jak łączniki:

/[\p{L}-]/u

Łącząc to wszystko razem, możesz dopasować słowa wszystkich [1] języków za pomocą tego pięknie krótkiego RegEx:

/([\p{L}-]+)/ug

Przykład (bezwstydnie podłączony do powyższej odpowiedzi ):

'Düsseldorf, Köln, Москва, 北京市, إسرائيل !@#$'.match(/([\p{L}-]+)/ug)

// ["Düsseldorf", "Köln", "Москва", "北京市", "إسرائيل"]

[1] Pamiętaj, że nie jestem ekspertem od języków. Nadal możesz chcieć przeprowadzić własne badania dotyczące innych znaków, które mogą być częścią słów oprócz liter i łączników.

Obsługa przeglądarki

Na dzień dzisiejszy (grudzień 2018 r.) Mogłem tylko z powodzeniem przetestować ten regex w Chrome (i innych przeglądarkach opartych na Blink, takich jak Opera, Vivaldi lub przyszłe wersje Microsoft Edge) i Safari (od wersji 12, wcześniejsze Testy z wersją 11 nie powiodło się). Ponieważ jednak specyfikacja jest zakończona, a funkcja jest znormalizowana, spodziewaj się, że wkrótce pojawią się inne nowoczesne przeglądarki.

Zrobiłem małą stronę internetową , aby sprawdzić, czy twoja przeglądarka obsługuje zmiany właściwości Unicode.

Transpiling

Ucieczki właściwości Unicode można przenosić do ES5 za pomocą narzędzia o nazwie regexpu . Jest takie demo on-line dostępne są tutaj . Jak widać w wersji demo, w rzeczywistości można dziś dopasować litery niełacińskie z następującym (okropnie długim) wyrażeniem regularnym ES5:

/(?:[A-Za-z\xAA\xB5\xBA\xC0-\xD6\xD8-\xF6\xF8-\u02C1\u02C6-\u02D1\u02E0-\u02E4\u02EC\u02EE\u0370-\u0374\u0376\u0377\u037A-\u037D\u037F\u0386\u0388-\u038A\u038C\u038E-\u03A1\u03A3-\u03F5\u03F7-\u0481\u048A-\u052F\u0531-\u0556\u0559\u0561-\u0587\u05D0-\u05EA\u05F0-\u05F2\u0620-\u064A\u066E\u066F\u0671-\u06D3\u06D5\u06E5\u06E6\u06EE\u06EF\u06FA-\u06FC\u06FF\u0710\u0712-\u072F\u074D-\u07A5\u07B1\u07CA-\u07EA\u07F4\u07F5\u07FA\u0800-\u0815\u081A\u0824\u0828\u0840-\u0858\u0860-\u086A\u08A0-\u08B4\u08B6-\u08BD\u0904-\u0939\u093D\u0950\u0958-\u0961\u0971-\u0980\u0985-\u098C\u098F\u0990\u0993-\u09A8\u09AA-\u09B0\u09B2\u09B6-\u09B9\u09BD\u09CE\u09DC\u09DD\u09DF-\u09E1\u09F0\u09F1\u09FC\u0A05-\u0A0A\u0A0F\u0A10\u0A13-\u0A28\u0A2A-\u0A30\u0A32\u0A33\u0A35\u0A36\u0A38\u0A39\u0A59-\u0A5C\u0A5E\u0A72-\u0A74\u0A85-\u0A8D\u0A8F-\u0A91\u0A93-\u0AA8\u0AAA-\u0AB0\u0AB2\u0AB3\u0AB5-\u0AB9\u0ABD\u0AD0\u0AE0\u0AE1\u0AF9\u0B05-\u0B0C\u0B0F\u0B10\u0B13-\u0B28\u0B2A-\u0B30\u0B32\u0B33\u0B35-\u0B39\u0B3D\u0B5C\u0B5D\u0B5F-\u0B61\u0B71\u0B83\u0B85-\u0B8A\u0B8E-\u0B90\u0B92-\u0B95\u0B99\u0B9A\u0B9C\u0B9E\u0B9F\u0BA3\u0BA4\u0BA8-\u0BAA\u0BAE-\u0BB9\u0BD0\u0C05-\u0C0C\u0C0E-\u0C10\u0C12-\u0C28\u0C2A-\u0C39\u0C3D\u0C58-\u0C5A\u0C60\u0C61\u0C80\u0C85-\u0C8C\u0C8E-\u0C90\u0C92-\u0CA8\u0CAA-\u0CB3\u0CB5-\u0CB9\u0CBD\u0CDE\u0CE0\u0CE1\u0CF1\u0CF2\u0D05-\u0D0C\u0D0E-\u0D10\u0D12-\u0D3A\u0D3D\u0D4E\u0D54-\u0D56\u0D5F-\u0D61\u0D7A-\u0D7F\u0D85-\u0D96\u0D9A-\u0DB1\u0DB3-\u0DBB\u0DBD\u0DC0-\u0DC6\u0E01-\u0E30\u0E32\u0E33\u0E40-\u0E46\u0E81\u0E82\u0E84\u0E87\u0E88\u0E8A\u0E8D\u0E94-\u0E97\u0E99-\u0E9F\u0EA1-\u0EA3\u0EA5\u0EA7\u0EAA\u0EAB\u0EAD-\u0EB0\u0EB2\u0EB3\u0EBD\u0EC0-\u0EC4\u0EC6\u0EDC-\u0EDF\u0F00\u0F40-\u0F47\u0F49-\u0F6C\u0F88-\u0F8C\u1000-\u102A\u103F\u1050-\u1055\u105A-\u105D\u1061\u1065\u1066\u106E-\u1070\u1075-\u1081\u108E\u10A0-\u10C5\u10C7\u10CD\u10D0-\u10FA\u10FC-\u1248\u124A-\u124D\u1250-\u1256\u1258\u125A-\u125D\u1260-\u1288\u128A-\u128D\u1290-\u12B0\u12B2-\u12B5\u12B8-\u12BE\u12C0\u12C2-\u12C5\u12C8-\u12D6\u12D8-\u1310\u1312-\u1315\u1318-\u135A\u1380-\u138F\u13A0-\u13F5\u13F8-\u13FD\u1401-\u166C\u166F-\u167F\u1681-\u169A\u16A0-\u16EA\u16F1-\u16F8\u1700-\u170C\u170E-\u1711\u1720-\u1731\u1740-\u1751\u1760-\u176C\u176E-\u1770\u1780-\u17B3\u17D7\u17DC\u1820-\u1877\u1880-\u1884\u1887-\u18A8\u18AA\u18B0-\u18F5\u1900-\u191E\u1950-\u196D\u1970-\u1974\u1980-\u19AB\u19B0-\u19C9\u1A00-\u1A16\u1A20-\u1A54\u1AA7\u1B05-\u1B33\u1B45-\u1B4B\u1B83-\u1BA0\u1BAE\u1BAF\u1BBA-\u1BE5\u1C00-\u1C23\u1C4D-\u1C4F\u1C5A-\u1C7D\u1C80-\u1C88\u1CE9-\u1CEC\u1CEE-\u1CF1\u1CF5\u1CF6\u1D00-\u1DBF\u1E00-\u1F15\u1F18-\u1F1D\u1F20-\u1F45\u1F48-\u1F4D\u1F50-\u1F57\u1F59\u1F5B\u1F5D\u1F5F-\u1F7D\u1F80-\u1FB4\u1FB6-\u1FBC\u1FBE\u1FC2-\u1FC4\u1FC6-\u1FCC\u1FD0-\u1FD3\u1FD6-\u1FDB\u1FE0-\u1FEC\u1FF2-\u1FF4\u1FF6-\u1FFC\u2071\u207F\u2090-\u209C\u2102\u2107\u210A-\u2113\u2115\u2119-\u211D\u2124\u2126\u2128\u212A-\u212D\u212F-\u2139\u213C-\u213F\u2145-\u2149\u214E\u2183\u2184\u2C00-\u2C2E\u2C30-\u2C5E\u2C60-\u2CE4\u2CEB-\u2CEE\u2CF2\u2CF3\u2D00-\u2D25\u2D27\u2D2D\u2D30-\u2D67\u2D6F\u2D80-\u2D96\u2DA0-\u2DA6\u2DA8-\u2DAE\u2DB0-\u2DB6\u2DB8-\u2DBE\u2DC0-\u2DC6\u2DC8-\u2DCE\u2DD0-\u2DD6\u2DD8-\u2DDE\u2E2F\u3005\u3006\u3031-\u3035\u303B\u303C\u3041-\u3096\u309D-\u309F\u30A1-\u30FA\u30FC-\u30FF\u3105-\u312E\u3131-\u318E\u31A0-\u31BA\u31F0-\u31FF\u3400-\u4DB5\u4E00-\u9FEA\uA000-\uA48C\uA4D0-\uA4FD\uA500-\uA60C\uA610-\uA61F\uA62A\uA62B\uA640-\uA66E\uA67F-\uA69D\uA6A0-\uA6E5\uA717-\uA71F\uA722-\uA788\uA78B-\uA7AE\uA7B0-\uA7B7\uA7F7-\uA801\uA803-\uA805\uA807-\uA80A\uA80C-\uA822\uA840-\uA873\uA882-\uA8B3\uA8F2-\uA8F7\uA8FB\uA8FD\uA90A-\uA925\uA930-\uA946\uA960-\uA97C\uA984-\uA9B2\uA9CF\uA9E0-\uA9E4\uA9E6-\uA9EF\uA9FA-\uA9FE\uAA00-\uAA28\uAA40-\uAA42\uAA44-\uAA4B\uAA60-\uAA76\uAA7A\uAA7E-\uAAAF\uAAB1\uAAB5\uAAB6\uAAB9-\uAABD\uAAC0\uAAC2\uAADB-\uAADD\uAAE0-\uAAEA\uAAF2-\uAAF4\uAB01-\uAB06\uAB09-\uAB0E\uAB11-\uAB16\uAB20-\uAB26\uAB28-\uAB2E\uAB30-\uAB5A\uAB5C-\uAB65\uAB70-\uABE2\uAC00-\uD7A3\uD7B0-\uD7C6\uD7CB-\uD7FB\uF900-\uFA6D\uFA70-\uFAD9\uFB00-\uFB06\uFB13-\uFB17\uFB1D\uFB1F-\uFB28\uFB2A-\uFB36\uFB38-\uFB3C\uFB3E\uFB40\uFB41\uFB43\uFB44\uFB46-\uFBB1\uFBD3-\uFD3D\uFD50-\uFD8F\uFD92-\uFDC7\uFDF0-\uFDFB\uFE70-\uFE74\uFE76-\uFEFC\uFF21-\uFF3A\uFF41-\uFF5A\uFF66-\uFFBE\uFFC2-\uFFC7\uFFCA-\uFFCF\uFFD2-\uFFD7\uFFDA-\uFFDC]|\uD800[\uDC00-\uDC0B\uDC0D-\uDC26\uDC28-\uDC3A\uDC3C\uDC3D\uDC3F-\uDC4D\uDC50-\uDC5D\uDC80-\uDCFA\uDE80-\uDE9C\uDEA0-\uDED0\uDF00-\uDF1F\uDF2D-\uDF40\uDF42-\uDF49\uDF50-\uDF75\uDF80-\uDF9D\uDFA0-\uDFC3\uDFC8-\uDFCF]|\uD801[\uDC00-\uDC9D\uDCB0-\uDCD3\uDCD8-\uDCFB\uDD00-\uDD27\uDD30-\uDD63\uDE00-\uDF36\uDF40-\uDF55\uDF60-\uDF67]|\uD802[\uDC00-\uDC05\uDC08\uDC0A-\uDC35\uDC37\uDC38\uDC3C\uDC3F-\uDC55\uDC60-\uDC76\uDC80-\uDC9E\uDCE0-\uDCF2\uDCF4\uDCF5\uDD00-\uDD15\uDD20-\uDD39\uDD80-\uDDB7\uDDBE\uDDBF\uDE00\uDE10-\uDE13\uDE15-\uDE17\uDE19-\uDE33\uDE60-\uDE7C\uDE80-\uDE9C\uDEC0-\uDEC7\uDEC9-\uDEE4\uDF00-\uDF35\uDF40-\uDF55\uDF60-\uDF72\uDF80-\uDF91]|\uD803[\uDC00-\uDC48\uDC80-\uDCB2\uDCC0-\uDCF2]|\uD804[\uDC03-\uDC37\uDC83-\uDCAF\uDCD0-\uDCE8\uDD03-\uDD26\uDD50-\uDD72\uDD76\uDD83-\uDDB2\uDDC1-\uDDC4\uDDDA\uDDDC\uDE00-\uDE11\uDE13-\uDE2B\uDE80-\uDE86\uDE88\uDE8A-\uDE8D\uDE8F-\uDE9D\uDE9F-\uDEA8\uDEB0-\uDEDE\uDF05-\uDF0C\uDF0F\uDF10\uDF13-\uDF28\uDF2A-\uDF30\uDF32\uDF33\uDF35-\uDF39\uDF3D\uDF50\uDF5D-\uDF61]|\uD805[\uDC00-\uDC34\uDC47-\uDC4A\uDC80-\uDCAF\uDCC4\uDCC5\uDCC7\uDD80-\uDDAE\uDDD8-\uDDDB\uDE00-\uDE2F\uDE44\uDE80-\uDEAA\uDF00-\uDF19]|\uD806[\uDCA0-\uDCDF\uDCFF\uDE00\uDE0B-\uDE32\uDE3A\uDE50\uDE5C-\uDE83\uDE86-\uDE89\uDEC0-\uDEF8]|\uD807[\uDC00-\uDC08\uDC0A-\uDC2E\uDC40\uDC72-\uDC8F\uDD00-\uDD06\uDD08\uDD09\uDD0B-\uDD30\uDD46]|\uD808[\uDC00-\uDF99]|\uD809[\uDC80-\uDD43]|[\uD80C\uD81C-\uD820\uD840-\uD868\uD86A-\uD86C\uD86F-\uD872\uD874-\uD879][\uDC00-\uDFFF]|\uD80D[\uDC00-\uDC2E]|\uD811[\uDC00-\uDE46]|\uD81A[\uDC00-\uDE38\uDE40-\uDE5E\uDED0-\uDEED\uDF00-\uDF2F\uDF40-\uDF43\uDF63-\uDF77\uDF7D-\uDF8F]|\uD81B[\uDF00-\uDF44\uDF50\uDF93-\uDF9F\uDFE0\uDFE1]|\uD821[\uDC00-\uDFEC]|\uD822[\uDC00-\uDEF2]|\uD82C[\uDC00-\uDD1E\uDD70-\uDEFB]|\uD82F[\uDC00-\uDC6A\uDC70-\uDC7C\uDC80-\uDC88\uDC90-\uDC99]|\uD835[\uDC00-\uDC54\uDC56-\uDC9C\uDC9E\uDC9F\uDCA2\uDCA5\uDCA6\uDCA9-\uDCAC\uDCAE-\uDCB9\uDCBB\uDCBD-\uDCC3\uDCC5-\uDD05\uDD07-\uDD0A\uDD0D-\uDD14\uDD16-\uDD1C\uDD1E-\uDD39\uDD3B-\uDD3E\uDD40-\uDD44\uDD46\uDD4A-\uDD50\uDD52-\uDEA5\uDEA8-\uDEC0\uDEC2-\uDEDA\uDEDC-\uDEFA\uDEFC-\uDF14\uDF16-\uDF34\uDF36-\uDF4E\uDF50-\uDF6E\uDF70-\uDF88\uDF8A-\uDFA8\uDFAA-\uDFC2\uDFC4-\uDFCB]|\uD83A[\uDC00-\uDCC4\uDD00-\uDD43]|\uD83B[\uDE00-\uDE03\uDE05-\uDE1F\uDE21\uDE22\uDE24\uDE27\uDE29-\uDE32\uDE34-\uDE37\uDE39\uDE3B\uDE42\uDE47\uDE49\uDE4B\uDE4D-\uDE4F\uDE51\uDE52\uDE54\uDE57\uDE59\uDE5B\uDE5D\uDE5F\uDE61\uDE62\uDE64\uDE67-\uDE6A\uDE6C-\uDE72\uDE74-\uDE77\uDE79-\uDE7C\uDE7E\uDE80-\uDE89\uDE8B-\uDE9B\uDEA1-\uDEA3\uDEA5-\uDEA9\uDEAB-\uDEBB]|\uD869[\uDC00-\uDED6\uDF00-\uDFFF]|\uD86D[\uDC00-\uDF34\uDF40-\uDFFF]|\uD86E[\uDC00-\uDC1D\uDC20-\uDFFF]|\uD873[\uDC00-\uDEA1\uDEB0-\uDFFF]|\uD87A[\uDC00-\uDFE0]|\uD87E[\uDC00-\uDE1D])/

Jeśli używasz Babel, tam również plugin regexpu zasilany za to ( Babel v6 wtyczki , Babel v7 plugin ).

Loilo
źródło
To jest właściwe rozwiązanie w moim przypadku. W szczególności: [\ p {L} \ s \ d], aby zaakceptować dowolną nazwę w dowolnym języku ze spacjami i cyframi. Link
referencyjny
Nazwy mogą nadal zawierać łączniki (dość powszechne tutaj, na przykład w Niemczech). Szczerze mówiąc, prawdopodobnie najlepiej nie przyjmować żadnych założeń dotyczących tego, jakie znaki zawiera poprawna nazwa.
Loilo
1
Najlepsza odpowiedź dla JS. Nadal nie jest obsługiwane w Edge / Firefox, więc przełożenie stil jest istotne.
Barry Staes
1
To jest żądanie funkcji firefox: bugzilla.mozilla.org/show_bug.cgi?id=1361876
bodo
1
@MatzHeri uFlaga została wprowadzona w ES2015 i umożliwia różne funkcje związane z Unicode (np. Znaki ucieczki własności wspomniane w mojej odpowiedzi, nawet jeśli zostały wprowadzone dopiero kilka lat później). Ponieważ funkcje związane z Unicode nieznacznie zmieniają semantykę niektórych wzorców wyrażeń regularnych, należy to wyraźnie włączyć - dodając tę uflagę.
Loilo
14

Odpowiedź udzielona przez Jeremy Ruten jest świetna, ale myślę, że nie do końca szukał tego Paul Wicks. Jeśli dobrze rozumiem, Paul zapytał o wyrażenie pasujące do słów innych niż angielskie, takich jakkönnen lub móc. Wyrażenie regularne Jeremy'ego pasuje tylko do liter nieanglojęzycznych, więc potrzeba drobnej poprawy:

([^\x00-\x7F]|\w)+

lub

([^\u0000-\u007F]|\w)+

Ta [^\x00-\x7F]i te [^\u0000-\u007F]części pozwalają, aby wyrażenie regularne pasowało do liter innych niż angielskie.

Jest (|)to logiczne lub\w angielskie litery, więc ([^\u0000-\u007F]|\w)będą pasować do pojedynczej litery angielskiej lub innej niż angielska.

+ na końcu wyrażenia oznacza, że ​​można go powtórzyć, więc całe wyrażenie pozwala na dopasowanie wszystkich liter angielskich lub nieanglojęzycznych.

Tutaj możesz przetestować pierwsze wyrażenie z różnymi ciągami, a tutaj jest drugie.

Landeeyo
źródło
6

Robisz to samo, co w przypadku każdego innego dopasowania znaków, ale używasz \ uXXXX, gdzie XXXX jest numerem Unicode znaku.

Spójrz na: http://unicode.org/charts/charindex.html

http://unicode.org/charts/

http://www.decodeunicode.org/

olle
źródło
z wyjątkiem faktu, że wyszukiwanie każdej rzeczy, którą można nazwać postacią, bez dodawania żadnych specjalnych symboli, takich jak spacje, znaki interpunkcyjne itp., jest sporym zadaniem.
My1
3

Wszystkie smaki Regex z obsługą Unicode powinny mieć specjalną klasę znaków, taką jak \ w, pasującą do dowolnej litery Unicode. Spójrz na swój specyficzny smak tutaj .

OregonGhost
źródło
7
Jest to poprawne dla większości smaków wyrażeń regularnych, ale nie dla JavaScript, przynajmniej zgodnie z regular-expressions.info/javascript.html
Paul Wicks
Więc chyba pech. Przynajmniej możesz użyć, a następnie użyć wykresów Unicode opublikowanych przez olle, aby znaleźć swoje postacie;)
OregonGhost
Myślę, że \ w zależy od ustawień kulturowych klienta.
troelskn
Nie wiem, ale w .NET zawsze możesz określić pożądaną kulturę. Poza tym, co jest literą, a co nie jest zdefiniowane w standardzie Unicode i nie jest zależne od kultury.
OregonGhost
0

Miałem problem z \ p działaniem zgodnie z oczekiwaniami, więc użyłem innej strategii, takiej jak:

([^\t]+)\t

Znajdź coś, co nie jest znakiem tabulacji, dopóki nie pojawi się następny znak tab ... oczywiście zależy to od źródła wyszukiwania, ale masz pomysł. Teraz nie muszę się zastanawiać, jakie znaki Unicode działają i nie działają itp.

Jonathan
źródło