charset utf 8 для чего

Кодировка UTF – основной стандарт текста в интернете

Нужно правильно раскодировать сигналы, которые наш мозг получает из окружающей среды. Проще говоря, следует правильно « настроить » свой взгляд на жизнь. Ну, вроде не полупустой кошелек, а наполовину полный. То есть, требуется использовать нужную кодировку. Для интернета чаще всего правильной является кодировка utf :

Немного о кодировках

Наверное, не является секретом тот факт, что основным типом содержимого во всемирном веб-пространстве является текст. Конечно, сейчас с этим утверждением можно поспорить, но буквально какой-то десяток лет назад это было так.

Но передача текста в цифровом формате происходит совсем иначе, чем у нас на экране. Для перевода текста в машинный код используется двоичная система исчисления, состоящая лишь из 0 и 1.

Чаще всего нужно всего лишь поменять кодировку веб-страницы на кодировку utf8. Ведь она является наиболее распространенной во всем интернете.

Кодировка UTF-8

Наиболее распространенная среди стандартизированных и общепринятых текстовых кодировок. Расшифровывается как « восьмибитный формат преобразования Юникода » или « Unicode Transformation Format ».

Стандарт был разработан еще в 1992 году. В настоящее время он широко применяется не только во всемирной паутине, но и на прикладном уровне ( локальные машины и операционные системы ). Основным достоинством кодировки является ее совместимость с ASCII:

ASCII («American standard code for information interchange») еще одна (но более старая) кодировка представления текстовых данных. В ее таблице символов значения печатных и непечатных знаков заданы с помощью чисел в шестнадцатеричной системе исчисления.

При использовании UTF-8 для передачи данных в формате ASCII используются 7 первых битов. Последний ( восьмой ) служит для вывода « мусора » ( некорректно раскодированных данных ). Что при использовании кодировки для латинских символов существенно уменьшает объем текстовых данных.

Как уже говорилось, часто для корректного отображения текста достаточно лишь поменять кодировку документа. Рассмотрим, как это можно сделать в различных дисциплинах, применяемых для построения веб-пространства.

Как установить кодировку в HTML и PHP

Глобальные настройки кодировки

Описанные выше методы могут использоваться для отдельных веб-страниц или небольших сайтов. Но что делать, если вы имеете дело с ресурсом, состоящим из нескольких сотен страниц и десятка разделов? Давайте разберемся, как установить кодировку utf 8 для всего сайта.

Как и в предыдущем примере, в нем нужно заменить значение AddDefaultCharset на нужное. В нашем случае это utf-8 :

Изменение кодировки базы данных

Здесь нужно поменять значение нескольких полей на utf-8 :

И затем добавить строку skip-character-set-client-handshake :

Сначала узнаем, какие кодировки установлены по умолчанию в нашей базе данных. Для этого вводим запрос SQL :

Вот какой ответ мы должны получить:

Если какие-либо значения нас не удовлетворяют, то нужно их изменить. Воспользуемся для этого запросом к ядру сервера СУБД:

Источник

Что такое кодировка UTF-8? Руководство для непрограммистов

Текст: его важность в Интернете само собой разумеется. Это первая буква «Т» в «HTTP», единственная буква «Т» в «HTML», и практически каждый веб-сайт каким-то образом использует ее, будь то URL-адрес, рекламный текст, обзор продукта, вирусный твит или Сообщение блога. (Всем привет!)

Но веб-текст на самом деле может быть не таким простым, как вы думаете. Рассмотрим тысячи языков, на которых сегодня говорят, или все знаки препинания и символы, которые мы можем добавить, чтобы улучшить их, или тот факт, что создаются новые смайлики, чтобы уловить каждую человеческую эмоцию. Как веб-сайты все это хранят и обрабатывают?

По правде говоря, даже такая простая вещь, как текст, требует хорошо скоординированной, четко определенной системы для отображения в веб-браузерах. В этом посте я объясню основы одной технологии, которая имеет ключевое значение для текста в Интернете, UTF-8. Мы изучим основы хранения и кодирования текста и обсудим, как это помогает размещать привлекательные слова на вашем сайте.

Прежде чем мы начнем, вы должны быть знакомы с основами HTML и готовы погрузиться в легкую информатику.

Что такое UTF-8?

UTF-8 означает «Формат преобразования Unicode – 8 бит». Это пока не помогает нам, поэтому давайте вернемся к основам.

Двоичный: как компьютеры хранят информацию

Для хранения информации компьютеры используют двоичную систему. В двоичном формате все данные представлены в виде последовательностей единиц и нулей. Самая основная единица двоичного кода – это бит, который представляет собой всего лишь 1 или 0. Следующая по величине единица двоичного кода, байт, состоит из 8 бит. Пример байта – «01101011».

Каждый цифровой актив, с которым вы когда-либо сталкивались – от программного обеспечения до мобильных приложений, от веб-сайтов до историй в Instagram – построен на этой системе байтов, которые связаны друг с другом таким образом, что это имеет смысл для компьютеров. Когда мы говорим о размерах файлов, мы имеем в виду количество байтов. Например, килобайт – это примерно тысяча байт, а гигабайт – примерно миллиард байтов.

Текст – это один из многих ресурсов, которые компьютеры хранят и обрабатывают. Текст состоит из отдельных символов, каждый из которых представлен в компьютерах строкой битов. Эти строки собираются в цифровые слова, предложения, абзацы, любовные романы и т.д.

ASCII: преобразование символов в двоичные

Американский стандартный код обмена информацией (ASCII) был ранней стандартизированной системой кодирования текста. Кодирование – это процесс преобразования символов человеческих языков в двоичные последовательности, которые могут обрабатывать компьютеры.

Библиотека ASCII включает все буквы в верхнем и нижнем регистре латинского алфавита (A, B, C…), каждую цифру от 0 до 9 и некоторые общие символы (например, /,! И?). Он присваивает каждому из этих символов уникальный трехзначный код и уникальный байт.

В таблице ниже показаны примеры символов ASCII с соответствующими кодами и байтами.

символ	Код ASCII	БАЙТ
А	065	01000001
а	097	01100001
B	066	01000010
б	098	01100010
С УЧАСТИЕМ	090	01011010
с участием	122	01111010
0	048	00110000
9	057	00111001
!	033	00100001
?	063	00111111

Подобно тому, как символы объединяются в слова и предложения в языке, двоичный код делает это в текстовых файлах. Итак, фраза «Быстрая коричневая лисица перепрыгивает через ленивого пса». в двоичном формате ASCII будет:

Это мало что значит для нас, людей, но это хлеб с маслом для компьютера.

Количество символов, которые может представлять ASCII, ограничено количеством доступных уникальных байтов, поскольку каждый символ получает один байт. Если вы посчитаете, то обнаружите, что существует 256 различных способов группировки восьми единиц и нулей вместе. Это дает нам 256 различных байтов или 256 способов представления символа в ASCII. Когда в 1960 году был представлен ASCII, это было нормально, поскольку разработчикам требовалось всего 128 байт для представления всех необходимых им английских символов и символов.

Но по мере глобального распространения компьютерных технологий компьютерные системы начали хранить текст не только на английском, но и на других языках, многие из которых использовали символы, отличные от ASCII. Были созданы новые системы для сопоставления других языков с тем же набором из 256 уникальных байтов, но использование нескольких систем кодирования было неэффективным и запутанным. Разработчикам требовался лучший способ кодирования всех возможных символов с помощью одной системы.

Юникод: способ хранить каждый символ, когда-либо

Используйте Unicode, систему кодирования, которая решает проблему пространства ASCII. Как и ASCII, Unicode присваивает каждому символу уникальный код, называемый кодовой точкой. Однако более сложная система Unicode может генерировать более миллиона кодовых точек, чего более чем достаточно для учета каждого символа на любом языке.

Юникод теперь является универсальным стандартом для кодирования всех человеческих языков. И да, он даже включает смайлы.

Ниже приведены несколько примеров текстовых символов и соответствующих им кодовых точек. Каждая кодовая точка начинается с буквы «U» для «Unicode», за которой следует уникальная строка символов для представления символа.

символ	Кодовая точка
А	U+0041
а	U+0061
0	U+0030
9	U+0039
!	U+0021
ОСТРОВ	U + 00D8
ڃ	U+0683
Ch	U + 0C9A
𠜎	U+2070E
😁	U+1F601

Если вы хотите узнать, как генерируются кодовые точки и что они означают в Unicode, ознакомьтесь с этим подробным объяснением.

Итак, теперь у нас есть стандартизированный способ представления каждого символа, используемого каждым человеческим языком, в единой библиотеке. Это решает проблему нескольких систем маркировки для разных языков – любой компьютер на Земле может использовать Unicode.

Но один только Unicode не хранит слова в двоичном формате. Компьютерам нужен способ перевода Unicode в двоичный код, чтобы его символы можно было хранить в текстовых файлах. Вот где пригодится UTF-8.

UTF-8: последний кусок головоломки

UTF-8 – это система кодирования Unicode. Он может преобразовывать любой символ Юникода в соответствующую уникальную двоичную строку, а также может преобразовывать двоичную строку обратно в символ Юникода. Это значение «UTF» или «Формат преобразования Unicode».

Помимо UTF-8, существуют и другие системы кодирования Unicode, но UTF-8 уникален, поскольку представляет символы в однобайтовых единицах. Помните, что один байт состоит из восьми бит, отсюда и «-8» в его названии.

Более конкретно, UTF-8 преобразует кодовую точку (которая представляет один символ в Unicode) в набор от одного до четырех байтов. Первые 256 символов в библиотеке Unicode, включая символы, которые мы видели в ASCII, представлены как один байт. Символы, которые появляются позже в библиотеке Unicode, кодируются как двухбайтовые, трехбайтовые и, возможно, четырехбайтовые двоичные единицы.

Ниже приведена та же таблица символов, что и выше, с выводом UTF-8 для каждого добавленного символа. Обратите внимание, что некоторые символы представлены одним байтом, а другие используют больше.

символ	Кодовая точка	Двоичная кодировка UTF-8
А	U+0041	01000001
а	U+0061	01100001
0	U+0030	00110000
9	U+0039	00111001
!	U+0021	00100001
ОСТРОВ	U + 00D8	11000011 10011000
ڃ	U+0683	11011010 10000011
Ch	U + 0C9A	11100000 10110010 10011010
𠜎	U+2070E	11110000 10100000 10011100 10001110
😁	U+1F601	11110000 10011111 10011000 10000001

Почему UTF-8 преобразовывает одни символы в один байт, а другие – в четыре байта? Короче для экономии памяти. Используя меньше места для представления более общих символов (например, символов ASCII), UTF-8 уменьшает размер файла, позволяя использовать гораздо большее количество менее распространенных символов. Эти менее распространенные символы кодируются в два или более байта, но это нормально, если они хранятся экономно.

Пространственная эффективность – ключевое преимущество кодировки UTF-8. Если бы вместо этого каждый символ Unicode был представлен четырьмя байтами, текстовый файл, написанный на английском языке, был бы в четыре раза больше, чем тот же файл, закодированный с помощью UTF-8.

Еще одно преимущество кодировки UTF-8 – обратная совместимость с ASCII. Первые 128 символов в библиотеке Unicode соответствуют символам в библиотеке ASCII, и UTF-8 переводит эти 128 символов Unicode в те же двоичные строки, что и ASCII. В результате UTF-8 может без проблем преобразовывать текстовый файл, отформатированный в ASCII, в читаемый человеком текст.

Символы UTF-8 в веб-разработке

UTF-8 – наиболее распространенный метод кодирования символов, используемый сегодня в Интернете, и набор символов по умолчанию для HTML5. Таким образом хранятся персонажи более 95% всех веб-сайтов, в том числе и ваш собственный. Кроме того, распространенные методы передачи данных через Интернет, такие как XML и JSON, кодируются стандартами UTF-8.

Поскольку теперь это стандартный метод кодирования текста в Интернете, все страницы вашего сайта и базы данных должны использовать UTF-8. Система управления контентом или конструктор веб-сайтов по умолчанию сохранят ваши файлы в формате UTF-8, но все же рекомендуется убедиться, что вы придерживаетесь этой передовой практики.

Текстовые файлы, закодированные с помощью UTF-8, должны указывать на это программному обеспечению, обрабатывающему их. В противном случае программа не сможет должным образом преобразовать двоичный код обратно в символы. В файлах HTML вы можете увидеть строку кода, подобную следующей, вверху:

Это сообщает браузеру, что файл HTML закодирован в UTF-8, чтобы браузер мог преобразовать его обратно в разборчивый текст.

UTF-8 против UTF-16

Как я уже упоминал, UTF-8 – не единственный метод кодирования символов Unicode – существует также UTF-16. Эти методы различаются количеством байтов, необходимых для хранения символа. UTF-8 кодирует символ в двоичную строку из одного, двух, трех или четырех байтов. UTF-16 кодирует символ Unicode в строку из двух или четырех байтов.

Это различие видно из их названий. В UTF-8 наименьшее двоичное представление символа составляет один байт или восемь битов. В UTF-16 наименьшее двоичное представление символа составляет два байта или шестнадцать бит.

И UTF-8, и UTF-16 могут переводить символы Unicode в двоичные файлы, удобные для компьютера, и обратно. Однако они несовместимы друг с другом. Эти системы используют разные алгоритмы для сопоставления кодовых точек с двоичными строками, поэтому двоичный вывод для любого заданного символа будет отличаться от обоих методов:

символ	Двоичная кодировка UTF-8	Двоичная кодировка UTF-16
А	01000001	01000001 11011000 00001110 11011111
𠜎	11110000 10100000 10011100 10001110	01000001 11011000 00001110 11011111

Кодировка UTF-8 предпочтительнее UTF-16 на большинстве веб-сайтов, потому что она использует меньше памяти. Напомним, что UTF-8 кодирует каждый символ ASCII всего одним байтом. UTF-16 должен кодировать эти же символы в двух или четырех байтах. Это означает, что текстовый файл на английском языке с кодировкой UTF-16 будет как минимум вдвое больше размера того же файла с кодировкой UTF-8.

UTF-16 более эффективен, чем UTF-8, только на некоторых неанглоязычных сайтах. Если веб-сайт использует язык с символами, находящимися дальше в библиотеке Unicode, UTF-8 будет кодировать все символы как четыре байта, тогда как UTF-16 может кодировать многие из тех же символов только как два байта. Тем не менее, если ваши страницы заполнены буквами ABC и 123, придерживайтесь UTF-8.

Расшифровка мира кодировки UTF-8

Это было много слов о словах, поэтому давайте резюмируем то, что мы рассмотрели:

Перевод Unicode – это не то, о чем большинству из нас нужно думать при просмотре или разработке веб-сайтов, и именно в этом суть – создать бесшовную систему обработки текста, которая работает для всех языков и веб-браузеров. Если он работает хорошо, вы этого не заметите.

Но если вы обнаружите, что страницы вашего веб-сайта занимают чрезмерно много места или если ваш текст завален буквами and и, пора применить ваши новые знания о UTF-8.

Источник

HTML Кодировка

Чтобы правильно отобразить HTML страницу, веб браузер должен знать, какой набор символов использовать.

Что такое кодировка символов?

ANSI (Windows-1252) был оригинальным Windows набор символов, с поддержкой 256 различных кодов символов.

ISO-8859-1 была кодировка по умолчанию для HTML 4. Этот набор символов тоже поддерживается 256 различных кодов символов.

Потому что ANSI и ISO-8859-1 были настолько ограничены, что HTML 4 также поддерживает UTF-8.

UTF-8 (Юникод) охватывает практически все знаки и символы в мире.

Кодировка по умолчанию для HTML5 является UTF-8.

HTML Атрибут charset

Для корректного отображения HTML страницы веб браузер должен знать набор символов, используемый на этой странице.

Это указано в теге :

Если браузер обнаруживает ISO-8859-1 на веб странице, он по умолчанию использует ANSI.

Различия между наборами символов

В следующей таблице показаны различия между наборами символов, описанными выше:

Число	ASCII	ANSI	8859	UTF-8	Описание
32	Пространство
33	!	!	!	!	Восклицательный знак
34	«	«	«	«	Кавычки двойные
35	#	#	#	#	Знак числа
36	$	$	$	$	Знак доллара
37	%	%	%	%	Знак процента
38	&	&	&	&	Амперсанд
39	‘	‘	‘	‘	Кавычки одинарные
40	(	(	(	(	Левая собка
41	)	)	)	)	Правая скобка
42	*	*	*	*	Звездочка
43	+	+	+	+	Плюс
44	,	,	,	,	Запятая
45	—	—	—	—	Дефис-минус
46	.	.	.	.	Точка
47	/	/	/	/	Косая черта
48	0	0	0	0	Число нуль
49	1	1	1	1	Число один
50	2	2	2	2	Число два
51	3	3	3	3	Число три
52	4	4	4	4	Число четыре
53	5	5	5	5	Число пять
54	6	6	6	6	Число шесть
55	7	7	7	7	Число семь
56	8	8	8	8	Число восемь
57	9	9	9	9	Число девять
58	:	:	:	:	Двоеточие
59	;	;	;	;	Точка с запятой
60	>	>	>	Знак больше чем
63	?	?	?	?	Знак вопроса
64	@	@	@	@	Коммерческая в
65	A	A	A	A	Латинская буква A
66	B	B	B	B	Латинская буква B
67	C	C	C	C	Латинская буква C
68	D	D	D	D	Латинская буква D
69	E	E	E	E	Латинская буква E
70	F	F	F	F	Латинская буква F
71	G	G	G	G	Латинская буква G
72	H	H	H	H	Латинская буква H
73	I	I	I	I	Латинская буква I
74	J	J	J	J	Латинская буква J
75	K	K	K	K	Латинская буква K
76	L	L	L	L	Латинская буква L
77	M	M	M	M	Латинская буква M
78	N	N	N	N	Латинская буква N
79	O	O	O	O	Латинская буква O
80	P	P	P	P	Латинская буква P
81	Q	Q	Q	Q	Латинская буква Q
82	R	R	R	R	Латинская буква R
83	S	S	S	S	Латинская буква S
84	T	T	T	T	Латинская буква T
85	U	U	U	U	Латинская буква U
86	V	V	V	V	Латинская буква V
87	W	W	W	W	Латинская буква W
88	X	X	X	X	Латинская буква X
89	Y	Y	Y	Y	Латинская буква Y
90	Z	Z	Z	Z	Латинская буква Z
91	[	[	[	[	Левая квадратная скобка
92	\	\	\	\	Обратный солидус
93	]	]	]	]	Правая квадратная скобка
94	^	^	^	^	Циркумфлекс ударение
95	_	_	_	_	Низкая линия
96	`	`	`	`	Знак ударения
97	a	a	a	a	Латинская строчная буква a
98	b	b	b	b	Латинская строчная буква b
99	c	c	c	c	Латинская строчная буква c
100	d	d	d	d	Латинская строчная буква d
101	e	e	e	e	Латинская строчная буква e
102	f	f	f	f	Латинская строчная буква f
103	g	g	g	g	Латинская строчная буква g
104	h	h	h	h	Латинская строчная буква h
105	i	i	i	i	Латинская строчная буква i
106	j	j	j	j	Латинская строчная буква j
107	k	k	k	k	Латинская строчная буква k
108	l	l	l	l	Латинская строчная буква l
109	m	m	m	m	Латинская строчная буква m
110	n	n	n	n	Латинская строчная буква n
111	o	o	o	o	Латинская строчная буква o
112	p	p	p	p	Латинская строчная буква p
113	q	q	q	q	Латинская строчная буква q
114	r	r	r	r	Латинская строчная буква r
115	s	s	s	s	Латинская строчная буква s
116	t	t	t	t	Латинская строчная буква t
117	u	u	u	u	Латинская строчная буква u
118	v	v	v	v	Латинская строчная буква v
119	w	w	w	w	Латинская строчная буква w
120	x	x	x	x	Латинская строчная буква x
121	y	y	y	y	Латинская строчная буква y
122	z	z	z	z	Латинская строчная буква z
123	<	<	<	<	Левая фигурная скобка
124	\|	\|	\|	\|	Вертикальная линия
125	>	>	>	>	Правая фигурная скобка
126	Тильда
127	DEL
128		Знак евро
129				НЕ ИСПОЛЬЗУЕТСЯ
130		Одинарная 9 низкая кавычка
131		Латинская строчная буква f с крючком
132		Двойная 9 низкая кавычка
133	Горизонтальное многоточие
134		Кинжал
135		Двойной кинжал
136		Письмо модификатор облеченным ударением
137		Знак промилле
138		Латинская буква S с caron
139		Одинарный угол влево низкая кавычка
140		Латинская заглавная лигатура OE
141				НЕ ИСПОЛЬЗУЕТСЯ
142		Латинская буква Z с caron
143				НЕ ИСПОЛЬЗУЕТСЯ
144				НЕ ИСПОЛЬЗУЕТСЯ
145		Левая одинарная низкая кавычка
146		Правая одинарная низкая кавычка
147		Левая двойная низкая кавычка
148		Правая двойная низкая кавычка
149		Маркер
150		Тире
151		Длинное тире
152		Маленькая тильда
153		Знак торговой марки
154		Латинская строчная буква s с caron
155		Одинарный угол вправо низкая кавычка
156		Латинская строчная лигатура oe
157				НЕ ИСПОЛЬЗУЕТСЯ
158		Латинская строчная буква z с caron
159		Латинская буква Y с diaeresis
160	Неразрывный пробел
161	¡	¡	¡	Перевернутый восклицательный знак
162	¢	¢	¢	Знак цента
163	£	£	£	Знак фунта
164	¤	¤	¤	Знак валюты
165	¥	¥	¥	Знак иены
166	¦	¦	¦	Прерывистая полоса
167	§	§	§	Знак раздела
168	¨	¨	¨	Трема
169	©	©	©	Знак авторского права
170	ª	ª	ª	Женский порядковый индикатор
171	«	«	«	Двойной угол влево
172	¬	¬	¬	Знак нет
173				Мягкий дефис
174	®	®	®	Зарегистрированный знак
175	¯	¯	¯	Макрон
176	°	°	°	Знак степени
177	±	±	±	Плюс-минус
178	²	²	²	Верхний индекс два
179	³	³	³	Верхний индекс три
180	´	´	´	Острый знак ударения
181	µ	µ	µ	Микро знак
182	¶	¶	¶	Знак абзаца
183	·	·	·	Точка посередине
184	¸	¸	¸	Седиль
185	¹	¹	¹	Верхний индекс один
186	º	º	º	Мужской порядковый индикатор
187	»	»	»	Двойной угол вправо
188	¼	¼	¼	Грубая дробь одна четвертая
189	½	½	½	Грубая дробь одна вторая
190	¾	¾	¾	Грубая дробь три четвертых
191	¿	¿	¿	Перевернутый вопросительный знак
192	À	À	À	Латинская буква A с grave
193	Á	Á	Á	Латинская буква A с acute
194	Â	Â	Â	Латинская буква A с circumflex
195	Ã	Ã	Ã	Латинская буква A с tilde
196	Ä	Ä	Ä	Латинская буква A с diaeresis
197	Å	Å	Å	Латинская буква A с ring above
198	Æ	Æ	Æ	Латинская буква AE
199	Ç	Ç	Ç	Латинская буква C с cedilla
200	È	È	È	Латинская буква E с grave
201	É	É	É	Латинская буква E с acute
202	Ê	Ê	Ê	Латинская буква E с circumflex
203	Ë	Ë	Ë	Латинская буква E с diaeresis
204	Ì	Ì	Ì	Латинская буква I с grave
205	Í	Í	Í	Латинская буква I с acute
206	Î	Î	Î	Латинская буква I с circumflex
207	Ï	Ï	Ï	Латинская буква I с diaeresis
208	Ð	Ð	Ð	Латинская буква Eth
209	Ñ	Ñ	Ñ	Латинская буква N с tilde
210	Ò	Ò	Ò	Латинская буква O с grave
211	Ó	Ó	Ó	Латинская буква O с acute
212	Ô	Ô	Ô	Латинская буква O с circumflex
213	Õ	Õ	Õ	Латинская буква O с tilde
214	Ö	Ö	Ö	Латинская буква O с diaeresis
215	×	×	×	Знак умножения
216	Ø	Ø	Ø	Латинская буква O с stroke
217	Ù	Ù	Ù	Латинская буква U с grave
218	Ú	Ú	Ú	Латинская буква U с acute
219	Û	Û	Û	Латинская буква U с circumflex
220	Ü	Ü	Ü	Латинская буква U с diaeresis
221	Ý	Ý	Ý	Латинская буква Y с acute
222	Þ	Þ	Þ	Латинская буква thorn
223	ß	ß	ß	Латинская строчная буква sharp s
224	à	à	à	Латинская строчная буква a с grave
225	á	á	á	Латинская строчная буква a с acute
226	â	â	â	Латинская строчная буква a с circumflex
227	ã	ã	ã	Латинская строчная буква a с tilde
228	ä	ä	ä	Латинская строчная буква a с diaeresis
229	å	å	å	Латинская строчная буква a с ring above
230	æ	æ	æ	Латинская строчная буква ae
231	ç	ç	ç	Латинская строчная буква c с cedilla
232	è	è	è	Латинская строчная буква e с grave
233	é	é	é	Латинская строчная буква e с acute
234	ê	ê	ê	Латинская строчная буква e с circumflex
235	ë	ë	ë	Латинская строчная буква e с diaeresis
236	ì	ì	ì	Латинская строчная буква i с grave
237	í	í	í	Латинская строчная буква i с acute
238	î	î	î	Латинская строчная буква i с circumflex
239	ï	ï	ï	Латинская строчная буква i с diaeresis
240	ð	ð	ð	Латинская строчная буква eth
241	ñ	ñ	ñ	Латинская строчная буква n с tilde
242	ò	ò	ò	Латинская строчная буква o с grave
243	ó	ó	ó	Латинская строчная буква o с acute
244	ô	ô	ô	Латинская строчная буква o с circumflex
245	õ	õ	õ	Латинская строчная буква o с tilde
246	ö	ö	ö	Латинская строчная буква o с diaeresis
247	÷	÷	÷	division sign
248	ø	ø	ø	Латинская строчная буква o с stroke
249	ù	ù	ù	Латинская строчная буква u с grave
250	ú	ú	ú	Латинская строчная буква u с acute
251	û	û	û	Латинская строчная буква с circumflex
252	ü	ü	ü	Латинская строчная буква u с diaeresis
253	ý	ý	ý	Латинская строчная буква y с acute
254	þ	þ	þ	Латинская строчная буква thorn
255	ÿ	ÿ	ÿ	Латинская строчная буква y с тремой

ASCII Набор символов

ASCII используются значения от 0 до 31 (и 127) для управляющих символов.

ASCII используются значения от 32 до 126 для букв, цифр и символов.

ASCII не используйте значения от 128 до 255.

ANSI Набор символов (Windows-1252)

ANSI идентичен ASCII для значений от 0 до 127.

ANSI имеет собственный набор символов для значений от 128 до 159.

ANSI идентична кодировке utf-8 для значений от 160 до 255.

Источник