中文字幕亚洲激情,亚洲制服丝袜中文字幕,亚洲欧美国产中文

Python2.x中的編碼問題

來源：千鋒教育

發布人：xqq

時間： 2023-11-11 07:11:21

1.str和unicode

str和unicode都是basestring的子類。嚴格意義上說，str其實是字節串，它是unicode經過編碼后的字節組成的序列。對UTF-8編碼的str'漢'使用len()函數時，結果是3，因為實際上，UTF-8編碼的'漢'=='\xE6\xB1\x89'。

unicode才是真正意義上的字符串，對字節串str使用正確的字符編碼進行解碼后獲得，并且len(u'漢')==1。

再來看看encode()和decode()兩個basestring的實例方法，理解了str和unicode的區別后，這兩個方法就不會再混淆了：

13#coding:UTF-8

u=u'漢'

printrepr(u)#u'\u6c49'

s=u.encode('UTF-8')

printrepr(s)#'\xe6\xb1\x89'

u2=s.decode('UTF-8')

printrepr(u2)#u'\u6c49'

#對unicode進行解碼是錯誤的

#s2=u.decode('UTF-8')

#同樣，對str進行編碼也是錯誤的

#u2=s.encode('UTF-8')

需要注意的是，雖然對str調用encode()方法是錯誤的，但實際上Python不會拋出異常，而是返回另外一個相同內容但不同id的str;對unicode調用decode()方法也是這樣。很不理解為什么不把encode()和decode()分別放在unicode和str中而是都放在basestring中，但既然已經這樣了，我們就小心避免犯錯吧。

2.字符編碼聲明

源代碼文件中，如果有用到非ASCII字符，則需要在文件頭部進行字符編碼的聲明，如下：

1#-*-coding:UTF-8-*-

實際上Python只檢查#、coding和編碼字符串，其他的字符都是為了美觀加上的。另外，Python中可用的字符編碼有很多，并且還有許多別名，還不區分大小寫，比如UTF-8可以寫成u8。參見http://docs.python.org/library/codecs.html#standard-encodings。

另外需要注意的是聲明的編碼必須與文件實際保存時用的編碼一致，否則很大幾率會出現代碼解析異常。現在的IDE一般會自動處理這種情況，改變聲明后同時換成聲明的編碼保存，但文本編輯器控們需要小心：)

3.讀寫文件

內置的open()方法打開文件時，read()讀取的是str，讀取后需要使用正確的編碼格式進行decode()。write()寫入時，如果參數是unicode，則需要使用你希望寫入的編碼進行encode()，如果是其他編碼格式的str，則需要先用該str的編碼進行decode()，轉成unicode后再使用寫入的編碼進行encode()。如果直接將unicode作為參數傳入write()方法，Python將先使用源代碼文件聲明的字符編碼進行編碼然后寫入。

14#coding:UTF-8

f=open('test.txt')

s=f.read()

f.close()

printtype(s)#

#已知是GBK編碼，解碼成unicode

u=s.decode('GBK')

f=open('test.txt','w')

#編碼成UTF-8編碼的str

s=u.encode('UTF-8')

f.write(s)

f.close()

另外，模塊codecs提供了一個open()方法，可以指定一個編碼打開文件，使用這個方法打開的文件讀取返回的將是unicode。寫入時，如果參數是unicode，則使用open()時指定的編碼進行編碼后寫入;如果是str，則先根據源代碼文件聲明的字符編碼，解碼成unicode后再進行前述操作。相對內置的open()來說，這個方法比較不容易在編碼上出現問題。

20#coding:GBK

importcodecs

f=codecs.open('test.txt',encoding='UTF-8')

u=f.read()

f.close()

printtype(u)#

f=codecs.open('test.txt','a',encoding='UTF-8')

#寫入unicode

f.write(u)

#寫入str，自動進行解碼編碼操作

#GBK編碼的str

s='漢'

printrepr(s)#'\xba\xba'

#這里會先將GBK編碼的str解碼為unicode再編碼為UTF-8寫入

f.write(s)

f.close()

4.與編碼相關的方法

sys/locale模塊中提供了一些獲取當前環境下的默認編碼的方法。

31#coding:gbk

importsys

importlocale

defp(f):

print'%s.%s():%s'%(f.__module__,f.__name__,f())

#返回當前系統所使用的默認字符編碼

p(sys.getdefaultencoding)

#返回用于轉換Unicode文件名至系統文件名所使用的編碼

p(sys.getfilesystemencoding)

#獲取默認的區域設置并返回元祖(語言,編碼)

p(locale.getdefaultlocale)

#返回用戶設定的文本數據編碼

#文檔提到thisfunctiononlyreturnsaguess

p(locale.getpreferredencoding)

#\xba\xba是'漢'的GBK編碼

#mbcs是不推薦使用的編碼，這里僅作測試表明為什么不應該用

printr"'\xba\xba'.decode('mbcs'):",repr('\xba\xba'.decode('mbcs'))

#在筆者的Windows上的結果(區域設置為中文(簡體,中國))

#sys.getdefaultencoding():gbk

#sys.getfilesystemencoding():mbcs

#locale.getdefaultlocale():('zh_CN','cp936')

#locale.getpreferredencoding():cp936

#'\xba\xba'.decode('mbcs'):u'\u6c49'

以上內容為大家介紹了Python2.x中的編碼問題，希望對大家有所幫助，如果想要了解更多Python相關知識，請關注 IT培訓機構:千鋒教育。

聲明：本站稿件版權均屬千鋒教育所有，未經許可不得擅自轉載。

python多版本與虛擬環境

Python的函數式編程與閉包

猜你喜歡LIKE

陸神

原去哪兒網高級架構師

北京大學計算機系畢業

HTML5學科教研總監

千鋒威哥

OCP認證專家

15年以上開發經驗

Java學科首席技術官

宋宋

原阿里后端架構師

北京郵電大學碩士

Python學科首席技術官

盧老師

北京大學博士后

北京科技大學博士

人工智能學科總監

索爾

原阿里后端架構師

浙工大計算機系畢業

Java學科高級講師

jackfrued

曾任職華為成都研究所

計算機應用技術博士

Python學科教學主管

快速通道 更多>>

課程介紹
點擊獲取大綱
就業前景
查看就業薪資
學習費用
了解課程價格
優惠活動
領取優惠券
學習資源
領3000G教程
師資團隊
了解師資團隊
實戰項目
獲取項目源碼
開班地區
查看來校路線

網友熱搜更多>>

IT行業年齡有限制嗎女生學IT Java薪資待遇零基礎Web培訓 Python就業如何學UI設計大數據學習路線 java培訓學費軟件測試培訓轉行學Linux 網絡安全基礎知識網絡營銷培訓 unity培訓 30歲還能學it嗎大數據技術學什么 python培訓費

Python2.x中的編碼問題

10年以上業內強師集結，手把手帶你蛻變精英

請您保持通訊暢通，專屬學習老師24小時內將與您1V1溝通

今日已有369人領取成功

猜你喜歡LIKE

python實現WSGI的框架

python打開文本文件有哪些方法?

python使用loguru操作日志

最新文章NEW

python-=是什么意思

pythonre是什么?

python列表追加元素出錯的解決

相關推薦HOT

pythonfor循環是什么

pythoncontextmanager()的轉換

python使用items()遍歷鍵值對

python實例方法中self的作用

熱門推薦

行業資訊 更多>>

長沙口碑好的云計算培訓機構有哪...

長沙哪個云計算培訓班靠譜

長沙培訓云計算哪個口碑好

長沙如何選擇云計算培訓機構

技術干貨

技術問答 在線提問>>

張同學在線提問

unity編輯器怎么調中文

劉同學在線提問

linux創建多級目錄的命令os.mkdir的方法

師資團隊更多>>

陸神

千鋒威哥

宋宋

盧老師

索爾

jackfrued

快速通道 更多>>

課程介紹

就業前景

學習費用

優惠活動

學習資源

師資團隊

實戰項目

開班地區

最新開班信息 更多>>

網友熱搜 更多>>

關于千鋒

新聞資訊

熱點話題

千鋒學習站 | 隨時隨地免費學

掃一掃進入千鋒手機站

行業資訊更多>>

技術問答在線提問>>

快速通道更多>>

最新開班信息更多>>

網友熱搜更多>>