一、说明
对于开发者来说,哪种语言对中文的支持都不是特别友好,毕竟人家都是英文起家。但在c++中,表现的更差。在学习计算机开始时,可能都接触过各种的编码标准,但那些标准如何落到语言层面上,则又是一个问题。从早期的宽字符串到普通字符串的来回转换,就已经让很多开发者头疼不已。
而c++标准库对unicode的完整支持比较有限。处理中文时,不管是源文件处理还是程序内部,尽量使用统一的utf-8编码。尽量只使用标准库中提供的std::string。只有在特殊的场景下才使用其它形式的编码形式,这样基本就可以保证中文处理的安全性。
也就是说,编程开发时,对中文处理分成三个层面:
- 源文件编码:编写cpp源文件时文件本身采用的编码
- 执行字符编码:编译器将普通字符串字面量转换成的编码
- 运行时数据编码:文件、终端、网络或数据库中的实际编码
这三种不一致是中文处理复杂的主要原因。常见的比如在windows上的源文件拷贝到linux下编译就报有各种问题,其实就是编码问题的原因。另外一个就是开发的机器上有一种中文字库而实际运行的机器上没有,就会出现中文的显示异常问题。
下面就从不同的层面上对c++如何进行中文字符串的处理进行分析说明。
二、编码层面
c++17中更好的提供了对utf-8的支持。c++17中,u8字符串字面量的元素类型是char,可以用std::string保存:
#include <iostream>
#include <string>
int main() {
std::string str = u8"朋友你好!";
std::cout << str << std::endl;
std::cout << "字节数:" << str.size() << std::endl;
return 0;
}
需要指出的是std::string本身并不知道内容采用哪种编码,它只是保存字节。只要程序约定其中保存utf-8,便可以安全地用于文件、网络和大部分跨平台接口。
字节数和字符数
很多开发者认为,字符数和字节数是一样的,这在英文场景下或许是对的。但对于unicode类型则不会如此。比如utf-8是一种变长编码。一般来说ascii字符通常占1字节而常用汉字通常占多个字节。
可以使用前面的例子进行说明:
std::string str = u8"朋友"; std::cout << str << std::endl; std::cout << "字节数:" << str.size() << std::endl;
通常输出6他字节,它表明这两人个汉字占用了六个字节的空间。
不要直接按字节截取汉字
下面的代码只取得“朋”的第一个utf-8字节:
std::string str = u8"朋友"; char firstbyte = str[0];
下面的操作会产生不完整的utf-8序列:
std::string broken = str.substr(0, 1);
即使使用substr(0, 3)暂时能够截取某个常用汉字,也不能作为通用方案,因为字符串中可能同时包含ascii、四字节字符、组合字符和emoji(表情符号)。
c++20的演进
不过随着标准的演进,到了c++20又有了变化,c++20中提供了char8_t。即从c++20开始,u8"中文"的元素类型变为char8_t,对应容器为std::u8string:
#include <iostream>
#include <string>
int main() {
std::u8string str = u8"朋友";
std::cout.write(
reinterpret_cast<const char *>(str.data()),
static_cast<std::streamsize>(str.size()));
std::cout << std::endl;
return 0;
}
c++20中不能直接写成:
std::string str = u8"朋友"; // 编译错误
需要与接收utf-8字节的旧接口配合时,可以集中提供一个转换函数:
#include <string>
#include <string_view>
std::string toutf8bytes(std::u8string_view str) {
return {
reinterpret_cast<const char *>(str.data()),
str.size()
};
}
这里转换的是相同utf-8数据的字节表示,不是字符集转码。
三、编译层面
设置编译器编码可以更好的处理中文字符的问题。源文件应使用utf-8保存,并让编译器按utf-8读取和生成字符串字面量。
gcc和clang
g++ -std=c++17 \ -finput-charset=utf-8 \ -fexec-charset=utf-8 \ main.cpp
其中:
- -finput-charset=utf-8指定源文件编码
- -fexec-charset=utf-8指定普通窄字符串的执行字符编码
msvc
msvc建议使用:
/utf-8
它相当于同时指定源文件字符集和执行字符集为utf-8。
cmake配置
if(msvc)
target_compile_options(yourtarget private /utf-8)
else()
target_compile_options(yourtarget private
-finput-charset=utf-8
-fexec-charset=utf-8
)
endif()如果第三方源文件仍然使用gbk或其他本地编码,最好先把源文件转换为utf-8,而不是让同一工程长期混用多种源文件编码。
四、不同字符串类型的含义
std::string:std::string保存字节,不自带编码信息。推荐约定其内容始终为utf-8。
std::u8stringstd::u8string从c++20开始使用char8_t表达utf-8编码单元,类型含义比std::string更明确,但与大量传统c接口和std::ostream配合不够方便。
std::u16string:std::u16string使用16位编码单元,通常用于保存utf-16。一个unicode码点可能需要两个char16_t代理项。
std::u32string:std::u32string使用32位编码单元,通常一个编码单元对应一个unicode码点,但一个码点仍不一定等于一个用户可见字符。
std::wstring:std::wstring依赖平台:
因此不能把std::wstring的原始内存直接写入跨平台文件、网络协议或数据库字段。
- windows中的wchar_t通常为16位,常用于utf-16
- linux中的wchar_t通常为32位,常用于utf-32
五、具体的场景
中文文件读写
utf-8文本文件可以直接用std::string读写:
#include <fstream>
#include <iostream>
#include <iterator>
#include <string>
int main() {
const std::string outputstr = u8"第一行中文\n第二行中文\n";
{
std::ofstream output("chinese.txt", std::ios::binary);
if (!output) {
std::cerr << "无法打开输出文件" << std::endl;
return 1;
}
output.write(
outputstr.data(),
static_cast<std::streamsize>(outputstr.size()));
}
{
std::ifstream input("chinese.txt", std::ios::binary);
if (!input) {
std::cerr << "无法打开输入文件" << std::endl;
return 1;
}
std::string content(
std::istreambuf_iterator<char>(input),
std::istreambuf_iterator<char>());
std::cout << content;
}
return 0;
}
二进制模式可以避免windows对换行符进行自动转换,文件内容仍然是utf-8文本。是否写入utf-8 bom应由外部文件格式决定,大多数现代程序和协议不需要bom。
读取外部文本时还需要确认:
- 文件是否确实为utf-8
- 是否带有bom
- 如何处理非法utf-8序列
- 是否需要统一换行符
- 是否需要unicode规范化
中文文件路径
linux文件路径本质上是字节序列,通常约定使用utf-8。windows文件api原生使用utf-16。
在qt中可以直接使用qstring路径:
qstring filepath = qstringliteral("/tmp/中文文件名.txt");
qfile file(filepath);
windows标准c++程序可以在转换为utf-16后构造路径:
std::filesystem::path path(utf8towide(utf8path));
不要在windows中把未知本地代码页的std::string直接当成unicode文件路径。
linux终端显示和输入中文
linux终端通常使用utf-8,可以检查当前环境:
locale
常见配置包括:
lang=zh_cn.utf-8
或者:
lang=en_us.utf-8
临时设置utf-8环境:
export lang=zh_cn.utf-8 export lc_all=zh_cn.utf-8
终端、字体和程序输入输出均支持utf-8时,可以直接使用:
std::string input; std::getline(std::cin, input); std::cout << input << std::endl;
std::getline()读入的仍然是字节序列,不会验证数据是否为合法utf-8。
windows控制台显示中文
使用msvc时先启用/utf-8。c++17程序可以把windows控制台输入输出代码页设置为utf-8:
#ifdef _win32
#include <windows.h>
#endif
#include <iostream>
int main() {
#ifdef _win32
setconsoleoutputcp(cp_utf8);
setconsolecp(cp_utf8);
#endif
std::cout << u8"你好,friends!" << std::endl;
return 0;
}
现代windows terminal对utf-8支持较好,旧版控制台还可能受到字体和c运行库行为影响。
调用windows系统api时优先使用以w结尾的unicode版本:
#include <windows.h>
int main() {
messageboxw(
nullptr,
l"中文信息",
l"题⽬",
mb_ok);
return 0;
}
windows utf-8和utf-16转换
std::wstring_convert和<codecvt>在c++17中已经被弃用,不适合新代码。windows上应使用系统api进行严格转换:
#ifdef _win32
#include <stdexcept>
#include <string>
#include <string_view>
#include <windows.h>
std::wstring utf8towide(std::string_view str) {
if (str.empty()) {
return {};
}
const int length = multibytetowidechar(
cp_utf8,
mb_err_invalid_chars,
str.data(),
static_cast<int>(str.size()),
nullptr,
0);
if (length <= 0) {
throw std::runtime_error("invalid utf-8");
}
std::wstring result(static_cast<std::size_t>(length), l'\0');
const int converted = multibytetowidechar(
cp_utf8,
mb_err_invalid_chars,
str.data(),
static_cast<int>(str.size()),
result.data(),
length);
if (converted != length) {
throw std::runtime_error("utf-8 conversion failed");
}
return result;
}
std::string widetoutf8(std::wstring_view str) {
if (str.empty()) {
return {};
}
const int length = widechartomultibyte(
cp_utf8,
wc_err_invalid_chars,
str.data(),
static_cast<int>(str.size()),
nullptr,
0,
nullptr,
nullptr);
if (length <= 0) {
throw std::runtime_error("invalid utf-16");
}
std::string result(static_cast<std::size_t>(length), '\0');
const int converted = widechartomultibyte(
cp_utf8,
wc_err_invalid_chars,
str.data(),
static_cast<int>(str.size()),
result.data(),
length,
nullptr,
nullptr);
if (converted != length) {
throw std::runtime_error("utf-16 conversion failed");
}
return result;
}
#endif
生产代码还应在转换前检查输入长度是否超过int_max,避免从std::size_t转换为int时发生溢出。
qt处理中文
一般来说,在qt中推荐统一使用qstring,这也算是平台的一种基础支持:
#include <qdebug>
#include <qstring>
int main() {
qstring text = qstringliteral("朋友你好!");
qdebug().noquote() << text;
qdebug() << text.size();
return 0;
}
不过需要注意的是,在qt中有着丰富的转换机制,这需要在处理中文时根据实际情况进行处理,如qstring和utf-8转换、qstring和std::string转换、qbytearray的处理,以及fromutf8和fromlocal8bit的选择等。
六、常见问题和解决
中文乱码通常来自以下问题:
- 源代码实际使用gbk,但编译器按utf-8读取
- 源代码使用utf-8,但执行字符集设置成gbk
- utf-8数据被当作gbk、latin-1或本地代码页解析
- windows控制台代码页不是utf-8
- 数据库字段、客户端连接和程序字符集不一致
- http响应没有声明正确的字符集
- 把qstring::tolocal8bit()误认为utf-8
- 使用std::string::substr()截断多字节字符
- 把wchar_t原始内存直接写入文件或网络
- 保存了临时qbytearray::constdata()返回的失效指针
- 对utf-8字节直接调用单字节大小写转换函数
- 文本虽然编码正确,但显示端缺少相应字体
排查乱码时应找到数据第一次发生变化的位置,并记录每个边界的实际字节。例如utf-8编码的“朋”对应十六进制字节通常为:
e6 9c 8b
如果内存和文件中仍然是这些字节,问题通常发生在解析或显示阶段;如果字节已经改变,则需要继续向数据来源方向排查错误转码的位置。也就是说分段检查,逐次逼近。
七、实践选择
对于开发者来说,实际的c++开发中,一般推荐如下处理:
- 源代码统一保存为utf-8
- gcc和clang显式配置输入及执行字符集,msvc启用/utf-8
- 标准c++项目将std::string明确约定为utf-8
- qt项目内部使用qstring,边界处显式调用fromutf8()和toutf8()
- 不使用字节下标、size()或普通substr()表示汉字数量和边界
- windows unicode api使用utf-16宽字符版本
- 不使用已弃用的std::wstring_convert编写新代码
- 文件、网络、json、数据库和日志等统一使用utf-8编码格式
- 对外部输入验证编码合法性,并明确非法序列处理策略
- 复杂unicode处理使用工具框架(qt或icu),尽量不自行实现不完整的字符算法
八、总结
对于字符的处理,看上去不是什么问题。但在实践中经常让开发者头疼。特别是在不同的团队合作时,这种问题更容易出现。所以统一开发和运行标准,是合作开发的前提。不要总想着最后适配,那会带来无穷的“灾难”。
以上就是c++如何正确使用std::string处理中文字符并避免乱码的详细内容,更多关于c++中文字符处理的资料请关注代码网其它相关文章!
发表评论