[精讚] [會員登入]
907

[PHP] UTF8中取出字串中特定的字數

要將字串,例如資料庫取出的TEXT,取出特定的字數

此文完整連結 http://n.sfs.tw/11609

複製連結 [PHP] UTF8中取出字串中特定的字數@新精讚
(文章歡迎轉載,務必尊重版權註明連結來源)
2019-10-23 17:49:20 最後編修
2017-08-12 22:04:54 By 張○○
 

一個字串可能帶有 html的TAG,多餘的空白,無意義的字元,或者為了存到資料庫中而加上的反斜線,若要取出特定的字數,就得把這些內容給篩選掉

因此我撰寫一個簡單的過濾函數

function StubUTF8String($str, $length=100){
  $str = stripslashes( $str );
  $str = strip_tags( $str);    //拿掉HTML的Tag
  $str = preg_replace('/[\n\r\t]/', ' ', $str);
  $str = preg_replace('/\s(?=\s)/', '', $str);
  $str = trim($str);
  return mb_substr( $str, 0, $length, "UTF-8");
}

第2-3行 把反斜線拿掉,移除html tag
第4行 把換行、TAB、行首字元改為空白' '
第5行 移除重覆的空白
第6行 移除頭尾的空白

這樣子基本上就沒有什麼大問題,但有一個小問題就是切英文字可能會把最後一個單字正好切斷。所以得加一個檢查,先少切一個字元,如果字串最後的字元是英文+數字,則把他取代掉。舉例來說,假設字串是這樣:

$str= "中國字英文<span style=\"color:#123455\">一二三四五</span>A running dog rams into a sleeping elephant.";

若要取長度11,則切的時候就切到第12位的地方,會是一個空白:

$str= "中國字英文一二三四五A ";

再把字串尾端的空白清掉就好。

如要要切長度12,則切13位,可以發現running 這個字被切破了,只剩一個'r':

$str= "中國字英文一二三四五A r";

發現第13 位是英文字母,那從第13位開始往前刪掉直到遇到非字母或數字即可。

這樣子還會有一個問題,就是取回的字串可能比原來的短,這也是沒辦法的事,畢竟切一半的英文字或數字是不行的。

但如果正好切斷的地方是國字,那麼少切一位的結果就回傳的中文字會多一個,因此最後還要多一個檢查,當回傳結果多一位時,要把他刪掉。

改寫後的程式,這樣不論切中切英都不會有問題了:

函式

/**
    *  StubUTF8String() -- UTF8下取出字串中特定的字數
    * @param string $str 傳入的字串
    * @param  int $length 取出的字數
    * @return 取回的字串
*/
function StubUTF8String($str, $length=40){
  $str = stripslashes( $str );
  $str = strip_tags( $str);    //拿掉HTML的Tag
  $str = preg_replace('/[\n\r\t]/', ' ', $str);
  $str = preg_replace('/\s(?=\s)/', '', $str);
  $str = mb_substr( $str, 0, $length+1, "UTF-8");
  $str = preg_replace('/[a-zA-Z]+$/', '', $str);
  $str = trim($str);
  if(mb_strlen($str)>$length)$str= mb_substr( $str, 0, -1, "UTF-8");
  return $str;
}

叫用

$str= "中國字英文 <span style=\"color:#123455\">一二三四五
六七八九十</span>A running dog ram into a sleeping elephant.";
print StubUTF8String($str,32);

輸出結果

中國字英文 一二三四五 六七八九十A running dog

多個空白和換行都被取代為一個空白' ',ram這個字取不完整捨棄,最後輸出共30個字元


編修 2009-10-28 23:36:03

你可能感興趣的文章

PHP 數字加解密函式 自寫的數字加解密,勉強用

[PHP] CodeIgniter 3+pure+smarty安裝及環境設置1/2 PHP framework CodeIgniter 3+ pure CSS +smarty Template Engine的整合

[PHP] 檢查IP是否在某個網段內 mtachcidr 要檢查IP是否在某個網段內,要寫幾行?10行?5行? 不用,只要2行。以下是我寫的 code /** * matchCI

[CodeIgniter 3] 修改或插入資料時遇到函數的處理 CI3 中要新增或修改的資料中如果有 now()這類的函數,要怎麼處理?

PHP程式經驗 #2 -- print和echo的差異 常在寫php的人一定會想知道echo和print這兩個函數有什麼不一樣 驗證 1. 比較print 和echo 函式的執

[PHP] 命名空間 namespace及 use PHP >=5.3 開始支援命名空間:namespace

[PHP] 陣列新增資料及整理 在php陣列加入項目和重新整理陣列的方法

[PHP] 判斷文字、數字、文字加數字的方法 幾個PHP數字和文字操作上的小眉角:判斷文字、數字、文字加數字的方法

[PHP] 將UTF8中文字轉成10進位或16進位數值 原本為了處理 preg_match 中文字的問題[2],用php把中文字轉換成10進位和6進位的數值編碼

[PHP] 好用的php常數 介紹PHP中 __DIR__, __FILE__, __FUNCTION__, __CLASS__, __METHOD__, __LINE__, __NAMESPACE__等常數

我有話要說


限制:留言最高字數1000字,超過部分會被截掉。請注意:留言不可帶有網址,會被濾掉。 限制:未登入訪客,每則留言間隔需超過10分鐘,每日最多5則留言。

訪客留言

[無留言]

隨機好文

[jQuery] select 元件的取值及給值 html中的元件select,在jquery中要如何使用?

[Windows7] 移除IE10及移除IE11 Windows7 不得已的情況要移除IE11或IE10怎麼做?

UTF8中文字/全形一覽 快速查詢urf-8的中文字,共計13246中文字(5401常用字+7652罕用字+日文或編號),292全形符號,27半形符號。

UTF-8的網頁但IE8一片空白 UTF8編碼的網頁在Firefox 正常顯示、但IE8 就是空白,IE8編碼設定是「自動偵測」可是自動偵測到的是 big5...

APACHE的記錄檔格式 LogFormat 語法 在APACHE中有定義一些記錄的語法模版 在 /etc/httpd/conf/httpd.conf 中: LogForm